jundot / omlx
연속 배치 및 SSD 캐싱을 지원하는 Apple Silicon용 LLM 추론 서버 — macOS 메뉴 막대에서 관리
이 프로젝트에 대해
jundot 님의 omlx 프로젝트는 GitHub에서 18.3K개의 별을 받으며 많은 개발자들의 주목을 받고 있습니다. 특히 Python 환경에서 유용하게 활용될 수 있으며, 최근 오픈소스 커뮤니티에서 활발한 기여와 토론이 이루어지고 있는 트렌딩 레포지토리입니다.
Language Breakdown
🇰🇷 한국어 번역 README
캐시 히트oMLX Mac용으로 최적화된 LLM 추론 연속 배치 및 계층형 KV 캐싱을 메뉴 바에서 직접 관리할 수 있습니다.
설치 · 빠른 시작 · 기능 · 모델 · CLI 구성 · 벤치마크 · oMLX.ai
영어 · 中文 · 한국어 · 日本語
제가 시도한 모든 LLM 서버는 편리함과 제어 중 하나를 선택하게 만들었습니다. 일상적인 모델을 메모리에 고정하고, 필요시 더 무거운 모델을 자동으로 교체하며, 컨텍스트 한계를 설정하고, 모든 것을 메뉴 바에서 관리하고 싶었습니다.
oMLX는 핫 메모리 계층과 콜드 SSD 계층에 걸쳐 KV 캐시를 유지합니다. 대화 중에 컨텍스트가 변경되더라도 과거 컨텍스트가 모두 캐시되어 요청 간 재사용이 가능하며, Claude Code와 같은 도구를 사용한 실제 코딩 작업에도 로컬 LLM을 실용적으로 사용할 수 있습니다. 그래서 제가 이걸 만들었습니다.
설치
macOS 앱
Releases에서 .dmg를 다운로드하고, Applications로 드래그하면 완료됩니다. 앱에는 인앱 자동 업데이트 기능이 포함되어 있어, 향후 업그레이드는 클릭 한 번으로 가능합니다. macOS 앱은 또한 경량 ~/.omlx/bin/omlx CLI 쉼을 설치하여 터미널 명령과 Apple Shortcuts로 앱 관리 서버를 제어할 수 있습니다.
Homebrew
선택 사항 GLM-5.2 / MiniMax M3 네이티브 커스텀 커널은 현재 HEAD 빌드가 필요합니다:
소스에서 설치
macOS 15.0+ (Sequoia), Python 3.11–3.13, Apple Silicon (M1/M2/M3/M4)가 필요합니다.
네이티브 커스텀 커널에 대한 참고: 단순
pip install -e .로는 빌드되지 않으며, 영향을 받는 모델 패밀리는 조용히 훨씬 느린 일반 경로로 대체됩니다 -- GLM-5.2의 경우
🌐 본 텍스트는 빠른 이해를 돕기 위한 요약 번역본입니다. 정확한 기술 정보 및 전체 코드는 GitHub 원문에서 확인하실 수 있습니다.
🔗 유사한 프로젝트
Epistates/pmetal
PMetal: high-performance Apple Silicon framework for local LLM inference, LoRA/QLoRA fine-tuning, serving, quantization, and MLX/Metal acceleration.
raspoli/mlx-serve
Local inference server for Apple Silicon — hot-swaps MLX models (LLM, vision, embeddings, TTS, STT) via OpenAI API
Mizistein/omlx
🤖 Optimize LLM inference on Mac with continuous batching and SSD caching managed from your menu bar for efficient performance.
이 정보는 AI가 자동으로 분석한 결과입니다. 정확한 내용은 원문을 확인하세요.
jundot/omlx GitHub 원문 바로가기 →