theogravity / dual-rtx-6000-blackwell-Gemma-4-31B-IT-NVFP4
vllm 및 도커를 사용하여 듀얼 RTX PRO 6000 Blackwell에서 MTP와 함께 Gemma 4 31B NVFP4용 최적화된 vLLM 설정: 네이티브 FP4 텐서 코어, 다중 토큰 예측(수용률 96.5%), 및 프리픽스 캐싱 포함. 벤치마크 결과 및 복제 스크립트 포함.
이 프로젝트에 대해
theogravity 님의 dual-rtx-6000-blackwell-Gemma-4-31B-IT-NVFP4 프로젝트는 GitHub에서 5개의 별을 받으며 많은 개발자들의 주목을 받고 있습니다. 특히 Shell 환경에서 유용하게 활용될 수 있으며, 최근 오픈소스 커뮤니티에서 활발한 기여와 토론이 이루어지고 있는 트렌딩 레포지토리입니다.
Language Breakdown
🇰🇷 한국어 번역 README
캐시 히트Gemma 4 31B NVFP4 + MTP 듀얼 RTX PRO 6000 Blackwell에서 — 최적화된 vLLM 설정
두 개의 RTX PRO 6000 Blackwell GPU( NVLink 없음)에서 nvidia/Gemma-4-31B-IT-NVFP4용 최적화된 vLLM 구성과 Gemma 4의 네이티브 다중 토큰 예측(MTP) 드래프터(google/gemma-4-31B-it-assistant) 활성화.
NVFP4 — Blackwell(GB202)은 네이티브 FP4 텐서 코어를 가진 최초의 GPU 아키텍처입니다. NVFP4는 품질 손실이 있는 것이 아니며, 하드웨어가 최대 처리량으로 동작하도록 설계된 포맷입니다. Blackwell에서는 NVFP4 GEMM이 BF16 대비 2배의 처리량을 낼 수 있습니다. Blackwell 이전의 GPU에서는 NVFP4가 에뮬레이션을 필요로 하며 아무런 이점을 제공하지 않지만, 여기서는 올바른 작동 모드입니다.
MTP (다중 토큰 예측) — Gemma 4는 병렬로 여러 토큰을 미리 예측하는 전용 약 5억 파라미터 드래프터 모델(google/gemma-4-31B-it-assistant)을 제공합니다. 4개의 추측 토큰을 사용할 경우, **수용률 96.5%**와 수용 길이 4.86을 측정했습니다 — 즉 거의 모든 드래프트가 완전히 수용됩니다. 결과적으로 출력 품질은 변하지 않으면서 처리량이 크게 증가합니다. 거부된 토큰은 폐기되며, 메인 모델의 출력이 항상 최종 권위를 가집니다.
이 저장소는 작동하는 vLLM 이미지, Blackwell에서 NVFP4 + MTP를 실행하기 위해 필요한 비직관적 수정 사항, AMD에서 CUDA P2P를 위한 GRUB 플래그, 추측 토큰, 최대 동시 시퀀스, 배치 크기 및 프리픽스 캐시 효율성을 기준으로 한 벤치마크 결과를 문서화합니다.
하드웨어
| CPU / 플랫폼 | AMD Ryze |
🌐 본 텍스트는 빠른 이해를 돕기 위한 요약 번역본입니다. 정확한 기술 정보 및 전체 코드는 GitHub 원문에서 확인하실 수 있습니다.
이 정보는 AI가 자동으로 분석한 결과입니다. 정확한 내용은 원문을 확인하세요.
theogravity/dual-rtx-6000-blackwell-Gemma-4-31B-IT-NVFP4 GitHub 원문 바로가기 →