Shoehorn – 어떤 모델이든 내 컴퓨터에 맞게 양자화해 실행
Shoehorn은 사용자의 하드웨어 메모리 예산에 맞춰 허깅페이스(Hugging Face) 인기 모델들을 양자화(quantize)하여 로컬에서 실행할 수 있게 해주는 오픈소스 도구입니다. 브라우저에서 내 장비에 맞는 모델을 스캔해 품질 순으로 보여주고, llama.cpp를 백엔드로 사용해 원 클릭으로 채팅까지 가능합니다. 맥(macOS), 리눅스, 윈도우를 지원하며 Homebrew나 바이너리 다운로드로 설치할 수 있습니다.
다운로드 전에 확인하세요. 내 장비에는 무엇이 맞을까요? 하드웨어를 선택하면 이 페이지가 허깅페이스(Hugging Face)에서 가장 많이 다운로드된 모델들을 스캔하여, shoehorn이 예산(메모리)에 맞출 수 있는 모델들을 찾아줍니다 — 메모리가 감당할 수 있는 품질 기준으로 순위가 매겨집니다. 모든 과정은 브라우저에서 실행됩니다.
내 장비 Mac — 8 GB / Mac — 16 GB / Mac — 24 GB / Mac — 32 GB / Mac — 48 GB / Mac — 64 GB / Mac — 96 GB / Mac — 128 GB GPU — 8 GB VRAM / GPU — 12 GB VRAM / GPU — 16 GB VRAM / GPU — 24 GB VRAM / GPU — 32 GB VRAM / 사용자 지정…
대화 컨텍스트 용량 4k 토큰 — 짧은 채팅 8k 토큰 — 일상적 사용 16k 토큰 — 긴 문서 32k 토큰 — 중편 소설 전체
사용 가능한 GPU 메모리(GiB) 모델 찾기
Shoehorn 설치 shoehorn은 추론 백엔드로 llama.cpp가 PATH에 설치되어 있어야 합니다(Homebrew 설치 시 자동으로 함께 설치됩니다). 그 다음 'shoehorn ui'를 실행하면 로컬 앱이 열립니다 — 모델을 고르고, 버튼 한 번 누르면 채팅이 시작됩니다.
brew install notactuallytreyanastasio/shoehorn/shoehorn (복사)
macOS Apple Silicon: 다운로드 → Linux x86-64 · NVIDIA 또는 AMD: 다운로드 → Windows x86-64 · NVIDIA: 다운로드 →
또는 소스에서 설치: 저장소를 클론한 후 'cargo install --path .' 실행. 전체 릴리스 보기.
이 앱 버튼 하나, 나의 전체 예산 로컬 웹 앱은 사용자의 장비 사양을 측정하고, 적합한 모델을 스트리밍으로 보여주며, 예산을 줄자(tape measure) 형태로 시각화하고, 양자화로 인한 품질 손실을 퍼플렉시티(perplexity) 수치로 표시한 뒤, 마지막에 채팅 버튼으로 마무리됩니다.