홈벤치: 로컬 LLM 속도·메모리·성능 벤치마크
홈벤치(Homebench)는 사용자의 PC에 설치된 로컬 LLM(Ollama, LM Studio 등)의 속도, 메모리 사용량, 품질을 측정하여 실시간 터미널 리더보드로 보여주는 도구입니다. 복잡한 설정이나 클라우드 API 키 없이 단 한 줄의 명령어로 실행되어, 개발자가 자신의 하드웨어 환경에 맞는 최적의 로컬 모델을 빠르고 직관적으로 찾을 수 있게 해줍니다.
원문 제목: Homebench – Benchmark local LLMs for speed, memory, and quality (로컬 LLM의 속도, 메모리, 품질 벤치마크) 소스: hackernews
본문: homebench는 현재 보유한 로컬 LLM의 속도, 메모리, 품질을 실시간 터미널 리더보드 형태로 벤치마크해 줍니다. homebench는 단일 명령어 기반 TUI(텍스트 사용자 인터페이스) 툴입니다. 로컬 모델 러너(Ollama, LM Studio, llama.cpp, vLLM 또는 모든 OpenAI 호환 서버)에 설치된 모델을 자동으로 찾아내고, 엄선된 품질 평가 테스트를 실행하며, 실제 사용자의 머신에서 초당 토큰 수(tokens/sec), 첫 토큰 응답 시간(TTFT), 메모리 사용량을 측정한 뒤 실시간 비교 리더보드를 그려줍니다.
pip install homebench
homebench
명령어 딱 두 줄이면 됩니다. 별도의 설정도, API 키도, 클라우드 연결도 필요하지 않습니다.
왜 이 도구가 필요한가? 이 문제와 관련하여 각각의 절반만 해결하는 훌륭한 도구들은 존재하지만, 로컬 환경에 초점을 맞춰 이 모든 것을 해결하는 도구는 없었습니다. 예를 들어, llama.cpp의 내장 도구인 'llama-bench'는 오직 속도만 측정합니다. 또한 'lm-evaluation-harness'는 품질을 측정하지만 일반 사용자 친화적인 UI가 부족하며 대중들이 로컬에서 주로 사용하는 모델 러너들을 기준으로 설계되지 않았습니다. homebench가 바로 이 공백을 메워줍니다: 로컬 우선(local-first), 제로 설정(zero-config), 그리고 뛰어난 사용자 경험(UX)을 제공합니다. 저장소를 복제(clone)하여 실행하고 이미 다운로드한 모델들을 가리키기만 하면, "내 로컬 모델 중 어느 것이 실제로 좋은가? 그리고 이 노트북에서 얼마나 빠르게 동작하는가?"라는 질문에 한눈에 답을 얻을 수 있습니다.
측정 항목 지표 | 측정 방식 tok/s | 생성된 출력 토큰 수 ÷ 생성 시간. Ollama는 서버 측 평가 시간을 보고하고, OpenAI 호환 백엔드는 토큰 스트림을 기준으로 클라이언트 측에서 시간을 측정합니다. 프롬프트 처리 및 모델 로드 시간은 제외됩니다. TTFT | 첫 번째 스트리밍 토큰이 생성될 때까지의 실제 경과 시간(러너가 보고하는 경우 모델 로드 시간 제외). 메모리(Memory) | 러너가 정보를 제공하는 경우(Ollama /api/ps, LM Studio /api/v0) 상주 모델 크기(Resident model size)를 측정하며, 백엔드 프로세스의 최대 RSS(물리 메모리 사용량) 샘플링을 최선을 다해 추가 측정합니다. 품질(Quality) | 수학, 추론, 사실적 회상, 지시사항 준수/구조화된 출력, 정보 추출 및 코드 이해 영역에 걸쳐 결정론적으로 점수가 매겨지는 31개의 태스크로 구성됩니다. 선택적으로 'LLM-as-judge' 기능을 사용하면 요약, 이메일 작성, 하이쿠(단시), 설명 등의 개방형 태스크를 추가할 수 있습니다.
설치 방법
pip install homebench
# 설치 후 실행:
homebench
격리된 환경에 설치하는 것을 선호하신다면 pipx를 사용하세요:
pipx install homebench
또는 소스 코드에서 직접 설치할 수도 있습니다:
git clone https://github.com/david-g-3654/homebench
cd homebench
pip install .
참고: Python 3.9 이상이 필요합니다.
사용법 homebench # 빠른 기본 실행: 가장 작은 3개 모델, 빠른 평가 제품군 실행 (TUI 모드) homebench --all # 탐색된 모든 모델 벤치마크 homebench --full # 전체 품질 평가 제품군 실행 (빠른 서브셋만 실행하지 않음) homebench --no-tui # 일반 실시간 렌더러 (파이프 및 CI 환경에 적합) homebench -m llama3.2,qwen3:8b # 특정 모델만 실행 homebench --limit 3 # 모델 수 제한 homebench --provider lmstudio # 자동 감지 대신 LM Studio 사용 homebench --provider llamacpp # llama.cpp 서버(llama-server) 사용 homebench --provider vllm # vLLM 사용 homebench --provider openai --host http://localhost:5000 # 모든 OpenAI 호환 서버 지정 homebench --refresh-cache # 캐시된 응답을 재사용하지 않고 다시 계산 homebench --no-quality # 속도 및 메모리만 측정 (빠름) homebench --no-speed # 품질만 측정 homebench --judge qwen3:8b # LLM-as-judge 활성화 (개방형 태스크 추가) homebench --tasks mypack.yaml # 내장 제품군 대신 커스텀 태스크 팩 사용 homebench --add-tasks mypack.yaml # 내장 제품군에 커스텀 팩 추가 homebench --label " before tuning " # 나중에 비교(diff)하기 위해 이번 실행에 태그 지정 homebench --md results.md # 마크다운 보고서로 내보내기 homebench --json results.json # 원시 JSON 형태로 내보내기 homebench list # 탐색된 모델 목록만 출력 homebench tasks # 품질 평가 제품군 표시 (--tasks로 팩 미리보기 가능) homebench history # 과거 실행 기록 목록 (자동 저장됨) homebench diff # 가장 최근 두 번의 실행 기록 비교 homebench diff 3 1 # 3번 실행(기준)과 1번 실행(최신) 비교 homebench throughput # 배치 처리량 스윕 (동시 실행 1, 2, 4, 8) homebench throughput --concurrency 1,8,16 --provider vllm # vLLM을 이용한 특정 동시성 테스트 homebench fit # 내 하드웨어에 인기 있는 모델 중 어떤 것을 구동할 수 있는지 확인
전체 옵션 목록을 보려면 homebench --help를 실행하세요.
예시 출력 Ollama를 통해 Apple M1(16 GB) 머신에서 실제로 빠른 평가 제품군(quick-suite)을 실행한 결과입니다: 최종 리더보드 ┏━━━┳━━━━━━━━━━━━━━━━━━━━━━┳━━━━━━━━┳━━━━━━━━━┳━━━━━━┳━━━━━━━┳━━━━━━━━┳━━━━━━━━┓ ┃ # ┃ 모델 ┃ 파라미터 ┃ 품질 ┃ 통과 ┃ tok/s ┃ TTFT ┃ 메모리 ┃ ┡━━━╇━━━━━━━━━━━━━━━━━━━━━━╇━━━━━━━━╇━━━━━━━━━╇━━━━━━╇━━━━━━━