TheTom / turboquant_plus
설명이 제공되지 않았습니다.
이 프로젝트에 대해
TheTom 님의 turboquant_plus 프로젝트는 GitHub에서 7.0K개의 별을 받으며 많은 개발자들의 주목을 받고 있습니다. 특히 Python 환경에서 유용하게 활용될 수 있으며, 최근 오픈소스 커뮤니티에서 활발한 기여와 토론이 이루어지고 있는 트렌딩 레포지토리입니다.
Language Breakdown
🇰🇷 한국어 번역 README
캐시 히트TurboQuant+
🚀 TurboQuant KV 캐시 압축이 이제 vLLM에 포함되었습니다 (PR #38479, 2026년 4월 병합):
--kv-cache-dtype turboquant_k8v4등, Triton의 저장/디코드 퓨즈 커널과 함께 제공됩니다. PR 논의는 이 저장소의 비대칭 K/V 발견을 참고했습니다. 업스트림 llama.cpp도 핵심 아이디어를 병합했습니다: Hadamard KV 캐시 회전 (#21038, TurboQuant 직접 인용)과 CPU (#22631), CUDA (#23615), Vulkan (#23687)에서의 빠른 WHT 커널입니다. 회전 + 기본 q4_0 캐시는 본질적으로 turbo4의 회전 단계이며, PolarQuant 코드북, 정규화 추출, 비대칭 정책은 여전히 여기와 포크에 존재합니다.
시작 가이드 | 구성 권장 사항 | 벤치마크 | 상용 지원
TurboQuant(ICLR 2026)의 구현과 기본 논문을 넘어선 구현 작업, 실험 및 후속 발견 사항을 포함합니다. PolarQuant + Walsh-Hadamard 회전을 사용하여 트랜스포머 KV 캐시를 3.8-6.4배 압축하며, q8_0 프리필 속도와 유사하며 긴 컨텍스트에서 디코드 처리량은 약 0.9배입니다. MacBook에서 1.5B부터 104B, 128K 컨텍스트까지 엔드투엔드로 검증되었습니다(터보3, PPL 4.024, 최대 메모리 74GB).
이 저장소는 연구의 중심 공간입니다: Python 참조 구현, 검증 논문, 벤치마크 데이터를 포함합니다. 추론 엔진에서 TurboQuant를 실행하려면 아래 표에서 선택하십시오. 유용하고 안정적인 구성 요소는 작은 검토 가능한 패치로 업스트림에 점진적으로 포함됩니다.
오늘 바로 실행하기
| 엔진 | 플랫폼 | 상태 | 비고 |
|---|
🌐 본 텍스트는 빠른 이해를 돕기 위한 요약 번역본입니다. 정확한 기술 정보 및 전체 코드는 GitHub 원문에서 확인하실 수 있습니다.
이 정보는 AI가 자동으로 분석한 결과입니다. 정확한 내용은 원문을 확인하세요.
TheTom/turboquant_plus GitHub 원문 바로가기 →