메뉴
HN
Hacker News • 23일 전

동일 모델, 하네스별 비용 최대 17배 차이 벤치마크

IMP
7/10
핵심 요약

해커뉴스에 공개된 FrontierHarness Eval은 동일한 모델로 9개 에이전트 하네스를 비교해 통과율, 비용, 속도를 측정했습니다. 그 결과 하네스 선택에 따라 과제당 비용이 최대 17배(Exo Harness $1.05 vs Claude Code $18.34)까지 차이났으며, 최고 통과율은 Codex(66.7%), 최고 비용효율은 Pi(60.0%·$2.43)로 나타났습니다. 코딩 에이전트 성능이 모델만이 아니라 하네스 설계에도 크게 좌우됨을 보여주는 의미 있는 벤치마크입니다.

번역된 본문

9개 하네스, 동일 모델, 통과당 비용은 최대 17배까지 차이가 납니다.

테스트된 하네스: Codex, DSH Creator, Claude Code, Pi, DSH PTC, DSH Standard, Oh My Pi, Kimi Code, DSH Minimal, Exo Harness, OpenCode, Hermes

주요 결과 (통과율 · 과제당 비용 · 소요 시간):

  • Codex: 66.7% · $3.47 · 6분 43초
  • DSH Creator: 63.3% · $3.28 · 6분 44초
  • Claude Code: 63.3% · $18.34 · 9분 38초
  • Pi: 60.0% · $2.43 · 7분 33초
  • DSH PTC: 60.0% · $4.58 · 7분 44초
  • DSH Standard: 60.0% · $3.46 · 6분 17초
  • Oh My Pi: 56.7% · $4.75 · 6분 46초
  • Kimi Code: 56.7% · $3.65 · 7분 56초
  • DSH Minimal: 56.7% · $4.72 · 5분 41초
  • Exo Harness: 53.3% · $1.05 · 6분 17초
  • OpenCode: 50.0% · $3.24 · 6분 27초
  • Hermes: 50.0% · $2.90 · 6분 58초

카테고리별 리더:

  • 품질 리더: Codex — 66.7% 통과율 · 과제당 $3.47
  • 균형형 선택: Pi — 60.0% 통과율 · 과제당 $2.43
  • 비용 리더: Exo Harness — 과제당 $1.05 · 53.3% 통과율
  • 속도 리더: DSH Minimal — 중위 실행 시간 5분 41초 · 56.7% 통과율

단위 토큰당 비용 (낮은 순): OpenCode $0.0615, Pi $0.0709, Exo Harness $0.0748, DSH Creator $0.1194, DSH Standard $0.1201, DSH Minimal $0.1214, Codex $0.1243, Oh My Pi $0.1354, DSH PTC $0.1370, Hermes $0.1746, Kimi Code $0.1818, Claude Code $0.2880

과제당 중위 비용 (낮은 순): Exo Harness $1.0452, Pi $2.4330, Hermes $2.9043, OpenCode $3.2443, DSH Creator $3.2849, DSH Standard $3.4589, Codex $3.4683, Kimi Code $3.6471, DSH PTC $4.5774, DSH Minimal $4.7180, Oh My Pi $4.7455, Claude Code $18.3368

캐시 적중률 (높은 순): Codex 88.0%, Kimi Code 88.0%, DSH PTC 87.2%, DSH Standard 86.5%, Hermes 85.9%, DSH Minimal 84.6%, DSH Creator 84.3%, Oh My Pi 82.2%, Pi 79.4%, OpenCode 78.4%, Exo Harness 70.3%, Claude Code 67.8%

참고 사항:

  1. OpenCode의 수치는 실패가 제외된 것으로, 성공 15건만 포함됩니다. 실패한 시도까지 계산하면 과제당 $3.24가 됩니다.
  2. 캐시 적중률은 비용이 아닙니다. 캐시가 적중된 300턴짜리 실패는 캐시 미스가 있는 짧은 실행보다 더 많은 비용을 소모할 수 있습니다.
  3. 품질과 비용은 어긋날 수 있습니다. Claude Code는 19개 과제를 통과했지만 과제당 비용이 $18.34에 달합니다.

Runta에서 자신의 하네스를 테스트하고 싶다면 시작 비용으로 $100 크레딧을 제공합니다.

사용 버전: Codex v0.148.0, DeepSeek Harness v0.1.0-rc.8, Claude Code v2.1.237, Pi v0.84.2, Oh My Pi v17.4.0, Kimi Code v0.37.2, Exo Harness v0.1.0, OpenCode v1.18.19, Hermes v0.20.4

FrontierHarness v1.0은 소프트웨어 엔지니어링 컨텍스트와 터미널 기반 과제에 초점을 맞추며, 다른 지식 작업 분야에는 일반화되지 않을 수 있습니다. Runta 에이전트 런타임에서 평가되었으며, 모든 하네스와 과제 환경은 골든 체크포인트로 한 번 준비되고, 매 실행은 동일한 vCPU, 메모리, 디스크 크기, 디스크 내용, 메모리 상태로 새롭게 복원됩니다.

원문 보기
원문 보기 (영어)
Codex DSH Creator Claude Code Pi DSH PTC DSH Standard Oh My Pi Kimi Code DSH Minimal Exo Harness OpenCode Hermes Cost Speed Pass rate 50.0% 55.6% 61.1% 66.7% $1 $2 $5 $10 $20 Codex 66.7% · $3.47 Codex 66.7% · $3.47 · 6m 43s DSH Creator 63.3% · $3.28 DSH Creator 63.3% · $3.28 · 6m 44s Claude Code 63.3% · $18.34 Claude Code 63.3% · $18.34 · 9m 38s Pi 60.0% · $2.43 Pi 60.0% · $2.43 · 7m 33s DSH PTC 60.0% · $4.58 DSH PTC 60.0% · $4.58 · 7m 44s DSH Standard 60.0% · $3.46 DSH Standard 60.0% · $3.46 · 6m 17s Oh My Pi 56.7% · $4.75 Oh My Pi 56.7% · $4.75 · 6m 46s Kimi Code 56.7% · $3.65 Kimi Code 56.7% · $3.65 · 7m 56s DSH Minimal 56.7% · $4.72 DSH Minimal 56.7% · $4.72 · 5m 41s Exo Harness 53.3% · $1.05 Exo Harness 53.3% · $1.05 · 6m 17s OpenCode 50.0% · $3.24 OpenCode 50.0% · $3.24 · 6m 27s Hermes 50.0% · $2.90 Hermes 50.0% · $2.90 · 6m 58s Median cost per task View blog GitHub Quality Leader : Codex 66.7% pass rate · $3.47 per task Balanced Pick : Pi 60.0% pass rate · $2.43 per task Cost Leader : Exo Harness $1.05 per task · 53.3% pass rate Speed Leader : DSH Minimal 5m 41s median runtime · 56.7% pass rate 01 Codex 66.7% 02 Claude Code 63.3% 03 DSH Creator 63.3% 04 DSH PTC 60.0% 05 DSH Standard 60.0% 06 Pi 60.0% 07 DSH Minimal 56.7% 08 Kimi Code 56.7% 09 Oh My Pi 56.7% 10 Exo Harness 53.3% 11 Hermes 50.0% 12 OpenCode 50.0% 01 OpenCode $0.0615 02 Pi $0.0709 03 Exo Harness $0.0748 04 DSH Creator $0.1194 05 DSH Standard $0.1201 06 DSH Minimal $0.1214 07 Codex $0.1243 08 Oh My Pi $0.1354 09 DSH PTC $0.1370 10 Hermes $0.1746 11 Kimi Code $0.1818 12 Claude Code $0.2880 01 Exo Harness $1.0452 02 Pi $2.4330 03 Hermes $2.9043 04 OpenCode $3.2443 05 DSH Creator $3.2849 06 DSH Standard $3.4589 07 Codex $3.4683 08 Kimi Code $3.6471 09 DSH PTC $4.5774 10 DSH Minimal $4.7180 11 Oh My Pi $4.7455 12 Claude Code $18.3368 01 Codex 88.0% 02 Kimi Code 88.0% 03 DSH PTC 87.2% 04 DSH Standard 86.5% 05 Hermes 85.9% 06 DSH Minimal 84.6% 07 DSH Creator 84.3% 08 Oh My Pi 82.2% 09 Pi 79.4% 10 OpenCode 78.4% 11 Exo Harness 70.3% 12 Claude Code 67.8% 01 DSH Minimal 5m 41s 02 DSH Standard 6m 17s 03 Exo Harness 6m 17s 04 OpenCode 6m 27s 05 Codex 6m 43s 06 DSH Creator 6m 44s 07 Oh My Pi 6m 46s 08 Hermes 6m 58s 09 Pi 7m 33s 10 DSH PTC 7m 44s 11 Kimi Code 7m 56s 12 Claude Code 9m 38s 01 OpenCode : failures excluded. It only covers 15 passes. Count failed attempts and the number becomes $ 3.24 per task. 02 Cache hit rate is not cost. A cached 300-turn failure can still burn more than a short cache miss. 03 Quality and cost can diverge. Claude Code passes 19 tasks, but reaches $ 18.34 in cost per task. Run your harness on Runta. If you want to test your own harness on Runta, we’ll give you $100 in credits to get started. Codex v 0.148.0 DeepSeek Harness v 0.1.0-rc.8 Claude Code v 2.1.237 Pi v 0.84.2 Oh My Pi v 17.4.0 Kimi Code v 0.37.2 Exo Harness v 0.1.0 OpenCode v 1.18.19 Hermes v 0.20.4 FrontierHarness v1.0 focuses on software engineering contexts and terminal-based tasks. It may not generalize to other areas of knowledge work. Evaluated on Runta agent runtimes. All harnesses and the task environment are prepared once as a golden checkpoint. Every run is a fresh restore with identical vCPU, memory, disk size, disk contents, and memory state. FrontierHarness Eval