트렌딩 목록으로
Python
apple-siliconinference-serverllmmacos

jundot / omlx

연속 배치 및 SSD 캐싱을 지원하는 Apple Silicon용 LLM 추론 서버 — macOS 메뉴 막대에서 관리

18.3K
1.6K
4일 전
GitHub에서 보기

이 프로젝트에 대해

jundot 님의 omlx 프로젝트는 GitHub에서 18.3K개의 별을 받으며 많은 개발자들의 주목을 받고 있습니다. 특히 Python 환경에서 유용하게 활용될 수 있으며, 최근 오픈소스 커뮤니티에서 활발한 기여와 토론이 이루어지고 있는 트렌딩 레포지토리입니다.

Language Breakdown

Python 75%Swift 11%HTML 7%C++ 4%JavaScript 2%Metal 1%

🇰🇷 한국어 번역 README

캐시 히트

oMLX Mac용으로 최적화된 LLM 추론 연속 배치 및 계층형 KV 캐싱을 메뉴 바에서 직접 관리할 수 있습니다.

junkim.dot@gmail.com ·

설치 · 빠른 시작 · 기능 · 모델 · CLI 구성 · 벤치마크 · oMLX.ai

영어 · 中文 · 한국어 · 日本語


제가 시도한 모든 LLM 서버는 편리함과 제어 중 하나를 선택하게 만들었습니다. 일상적인 모델을 메모리에 고정하고, 필요시 더 무거운 모델을 자동으로 교체하며, 컨텍스트 한계를 설정하고, 모든 것을 메뉴 바에서 관리하고 싶었습니다.

oMLX는 핫 메모리 계층과 콜드 SSD 계층에 걸쳐 KV 캐시를 유지합니다. 대화 중에 컨텍스트가 변경되더라도 과거 컨텍스트가 모두 캐시되어 요청 간 재사용이 가능하며, Claude Code와 같은 도구를 사용한 실제 코딩 작업에도 로컬 LLM을 실용적으로 사용할 수 있습니다. 그래서 제가 이걸 만들었습니다.

설치

macOS 앱

Releases에서 .dmg를 다운로드하고, Applications로 드래그하면 완료됩니다. 앱에는 인앱 자동 업데이트 기능이 포함되어 있어, 향후 업그레이드는 클릭 한 번으로 가능합니다. macOS 앱은 또한 경량 ~/.omlx/bin/omlx CLI 쉼을 설치하여 터미널 명령과 Apple Shortcuts로 앱 관리 서버를 제어할 수 있습니다.

Homebrew

선택 사항 GLM-5.2 / MiniMax M3 네이티브 커스텀 커널은 현재 HEAD 빌드가 필요합니다:

소스에서 설치

macOS 15.0+ (Sequoia), Python 3.11–3.13, Apple Silicon (M1/M2/M3/M4)가 필요합니다.

네이티브 커스텀 커널에 대한 참고: 단순 pip install -e .로는 빌드되지 않으며, 영향을 받는 모델 패밀리는 조용히 훨씬 느린 일반 경로로 대체됩니다 -- GLM-5.2의 경우


🌐 본 텍스트는 빠른 이해를 돕기 위한 요약 번역본입니다. 정확한 기술 정보 및 전체 코드는 GitHub 원문에서 확인하실 수 있습니다.

🔗 유사한 프로젝트

이 정보는 AI가 자동으로 분석한 결과입니다. 정확한 내용은 원문을 확인하세요.

jundot/omlx GitHub 원문 바로가기 →