djeday123 / fa-blackwell-fp8
NVIDIA Blackwell 소비자 GPU(sm_120a, 예: RTX PRO 6000)용 생산 등급 FlashAttention FP8 e4m3 순방향 커널. hd=128, sl=8192에서 647–652 TFLOPS. 멀티 커널 디스패처, Go 및 Python 바인딩이 있는 C 라이브러리
이 프로젝트에 대해
djeday123 님의 fa-blackwell-fp8 프로젝트는 GitHub에서 2개의 별을 받으며 많은 개발자들의 주목을 받고 있습니다. 특히 Cuda 환경에서 유용하게 활용될 수 있으며, 최근 오픈소스 커뮤니티에서 활발한 기여와 토론이 이루어지고 있는 트렌딩 레포지토리입니다.
Language Breakdown
🇰🇷 한국어 번역 README
캐시 히트fa-blackwell-fp8 — NVIDIA Blackwell 소비자 GPU용 FlashAttention FP8 순전파
NVIDIA Blackwell 소비자 카드(컴퓨팅 능력 12.0, 예: RTX PRO 6000 Blackwell Workstation Edition)에서 FP8 e4m3로 FlashAttention 순전파를 위한 생산급 C 라이브러리 + Go 및 Python 바인딩.
- 저자: Vugar Bakhshaliyev
- 라이선스: Apache-2.0 —
LICENSE와NOTICE참조 - 기술 문서: 곧 공개 예정
주요 수치
30회 실행, 동일 온도 벤치, NVIDIA 드라이버 580.159.03,
RTX PRO 6000 Blackwell Workstation Edition.
| 구성 (BH × SL × HD, 윈도우) | TFLOPS (평균 ± σ) | 커널 |
|---|---|---|
| 64 × 8192 × 128, wnd=0 (주 피크) | 647.14 ± 0.64 | v121r |
| 128 × 8192 × 128, wnd=0 (보조 피크) | 652.40 ± 0.87 | v121r |
| 64 × 8192 × 64, wnd=0 | 466.8 | v89 |
생산용 커널 v121r: 레지스터 255개, 스필 0, 스택 프레임 0,
이중 버퍼 K, 단일 버퍼 V, 반복 중간 V[N+1]를 죽은 K 슬롯으로 선불(prefetch),
Sr→half2 소프트맥스는 ex2.approx.f16x2 통해 수행.
출처: src/_v121r_kernel.cu.
fa_version()은 0.1.0+652T-sm120a 반환.
이 라이브러리를 사용하는 이유
FlashAttention 2/3 레퍼런스 구현은 Hopper (sm_90)를 대상으로 하며,
이 리포지토리가 공개된 시점 기준, 소비자 Blackwell(sm_120a)용 튜닝된 FP8 순전파 경로는 없음.
NVIDIA의 TensorRT-LLM도 동일한 격차를 이슈 #11799에서 다룸,
이는 "없음"에 대한 정식 업스트림 레퍼런스로 간주됨.
🌐 본 텍스트는 빠른 이해를 돕기 위한 요약 번역본입니다. 정확한 기술 정보 및 전체 코드는 GitHub 원문에서 확인하실 수 있습니다.
🔗 유사한 프로젝트
sgl-project/sglang
SGLang is a high-performance serving framework for large language models and multimodal models.
NVIDIA/cudnn-frontend
cuDNN Frontend is NVIDIA's modern, open-source entry point to the cuDNN library and a growing collection of high-performance open-source kernels.
AlcAI-Haven/FastFlashAttention
Drop-in exact bf16 flash-attention for CUDA with a deterministic backward, tuned for Blackwell (sm_120 / RTX 5090).
이 정보는 AI가 자동으로 분석한 결과입니다. 정확한 내용은 원문을 확인하세요.
djeday123/fa-blackwell-fp8 GitHub 원문 바로가기 →