트렌딩 목록으로
Cuda
attentionblackwellcudaflash-attention

djeday123 / fa-blackwell-fp8

NVIDIA Blackwell 소비자 GPU(sm_120a, 예: RTX PRO 6000)용 생산 등급 FlashAttention FP8 e4m3 순방향 커널. hd=128, sl=8192에서 647–652 TFLOPS. 멀티 커널 디스패처, Go 및 Python 바인딩이 있는 C 라이브러리

이 프로젝트에 대해

djeday123 님의 fa-blackwell-fp8 프로젝트는 GitHub에서 2개의 별을 받으며 많은 개발자들의 주목을 받고 있습니다. 특히 Cuda 환경에서 유용하게 활용될 수 있으며, 최근 오픈소스 커뮤니티에서 활발한 기여와 토론이 이루어지고 있는 트렌딩 레포지토리입니다.

Language Breakdown

Cuda 59%C 17%Python 11%Go 6%C++ 5%Makefile 3%

🇰🇷 한국어 번역 README

캐시 히트

fa-blackwell-fp8 — NVIDIA Blackwell 소비자 GPU용 FlashAttention FP8 순전파

NVIDIA Blackwell 소비자 카드(컴퓨팅 능력 12.0, 예: RTX PRO 6000 Blackwell Workstation Edition)에서 FP8 e4m3FlashAttention 순전파를 위한 생산급 C 라이브러리 + Go 및 Python 바인딩.

  • 저자: Vugar Bakhshaliyev
  • 라이선스: Apache-2.0 — LICENSENOTICE 참조
  • 기술 문서: 곧 공개 예정

주요 수치

30회 실행, 동일 온도 벤치, NVIDIA 드라이버 580.159.03, RTX PRO 6000 Blackwell Workstation Edition.

구성 (BH × SL × HD, 윈도우)TFLOPS (평균 ± σ)커널
64 × 8192 × 128, wnd=0 (주 피크)647.14 ± 0.64v121r
128 × 8192 × 128, wnd=0 (보조 피크)652.40 ± 0.87v121r
64 × 8192 × 64, wnd=0466.8v89

생산용 커널 v121r: 레지스터 255개, 스필 0, 스택 프레임 0,
이중 버퍼 K, 단일 버퍼 V, 반복 중간 V[N+1]를 죽은 K 슬롯으로 선불(prefetch),
Sr→half2 소프트맥스는 ex2.approx.f16x2 통해 수행.
출처: src/_v121r_kernel.cu.

fa_version()0.1.0+652T-sm120a 반환.


이 라이브러리를 사용하는 이유

FlashAttention 2/3 레퍼런스 구현은 Hopper (sm_90)를 대상으로 하며,
이 리포지토리가 공개된 시점 기준, 소비자 Blackwell(sm_120a)용 튜닝된 FP8 순전파 경로는 없음.
NVIDIA의 TensorRT-LLM도 동일한 격차를 이슈 #11799에서 다룸,
이는 "없음"에 대한 정식 업스트림 레퍼런스로 간주됨.


🌐 본 텍스트는 빠른 이해를 돕기 위한 요약 번역본입니다. 정확한 기술 정보 및 전체 코드는 GitHub 원문에서 확인하실 수 있습니다.

🔗 유사한 프로젝트

이 정보는 AI가 자동으로 분석한 결과입니다. 정확한 내용은 원문을 확인하세요.

djeday123/fa-blackwell-fp8 GitHub 원문 바로가기 →