동일한 Three.js 과제에 10가지 모델·하네스 조합 테스트
한 개발자가 동일한 Three.js SF 격납고 제작 프롬프트를 10가지 모델과 코딩 하네스 조합으로 실행해 성능을 비교했습니다. 처리 시간, 토큰 사용량, 캐싱 비율, 도구 호출 오류, 브라우저 실행 여부 등 세부 지표를 공개했습니다. 특히 Qwen 3.8 27B와 OpenCode 조합은 8분 만에 적은 토큰으로 완성했고, SOL 5.6 등 일부 조합은 결과물이 제대로 동작하지 않았습니다.
행거 하네스 / 모델 테스트 — 저는 간단한 프롬프트를 여러 모델과 하네스 조합으로 테스트하여 어느 조합이 가장 좋은 결과를 내는지 확인해왔습니다. /goal 모드에서 진행했습니다.
프롬프트: 호버링 드론, 애니메이션 경고등, 발광(emissive) 활주로 스트립, 은은한 볼류메트릭 스타일 안개 평면이 있는 Three.js SF 격납고 단일 페이지를 만들어라. 드론 편대 토글과 시네마틱 카메라 경로를 포함하라. 인라인 자바스크립트가 포함된 자립형 HTML 파일 하나로 출력하라.
결과 표:
- GLM 5.3 Flash Max / Codex Open: 9분, 첫 토큰까지 0.232초, 입력 457,685 토큰, 출력 17,458 토큰(추론 7,694), 총 475,143 토큰, 캐시된 입력 85.26%, 도구 호출 14회(오류 1회), 브라우저에서 차단됨
- Luna 5.6 Max / Codex Open: 9분, 입력 1,146,755 토큰, 출력 25,512 토큰, 캐시 92.76%, 도구 호출 32회(오류 2회), 브라우저 실행 확인, 스크린샷 확인
- SOL 5.6 Max / Codex Open: 10분, 입력 1,069,163 토큰, 캐시 94.60%, 도구 오류 5회, 브라우저 실행 안 됨
- Astra 6.0 Max / Codex Open: 37분, 입력 1,292,366 토큰, 출력 43,129 토큰(추론 15,271), 캐시 94.93%, 도구 오류 5회, 브라우저 실행은 됐으나 스크린샷 확인 불가
- GLM 5.3 Flash Max / OMP Open: 30분, 입력 1,678,509 토큰, 출력 63,405 토큰, 캐시 78.54%, 도구 호출 57회(오류 0), 브라우저·스크린샷 확인
- Qwen 3.8 27B x-high / OMP Open: 41분, 입력 3,407,451 토큰, 출력 71,935 토큰(추론 49,131), 캐시 86.92%, 도구 호출 89회(오류 0), 브라우저·스크린샷 확인
- GLM 5.3 Flash Max / OpenCode Open: 20분, 입력 4,305,447 토큰, 출력 50,468 토큰(추론 33,414), 캐시 96.89%, 도구 호출 67회(오류 0), 브라우저·스크린샷 확인
- Qwen 3.8 27B x-high / OpenCode Open: 8분, 입력 665,490 토큰, 출력 41,817 토큰(추론 28,788), 캐시 95.64%, 도구 호출 13회(오류 0), 브라우저·스크린샷 확인
- Qwen 3.8 27B x-high / DSH / PTC Open: 24분, 입력 1,012,499 토큰, 출력 89,894 토큰, 캐시 91.69%, 도구 호출 23회(오류 5), 브라우저·스크린샷 확인
- Qwen 3.8 27B x-high / DSH Open: 18분, 입력 2,654,457 토큰, 출력 78,232 토큰, 캐시 95.48%, 도구 호출 42회(오류 2), 브라우저 실행 안 됨
참고 사항: 모든 GLM 실행은 'GLM 5.3 Flash Max'로 표기되었으며, 입력 토큰에는 캐시된 입력이 포함됩니다. 출력 토큰은 추론을 포함한 총 생성량이며, 하네스가 추론을 별도로 보고하는 경우 추론 컬럼에 해당 부분이 표시됩니다. DSH 어댑터는 별도의 추론 카운트를 보고하지 않습니다. DSH 소요 시간은 두 턴 간 일시정지를 제외한 활성 턴 시간의 합계입니다. 도구 오류는 기록된 실패한 도구 이벤트입니다. 대시(-)는 사용 불가 또는 미보고를 의미합니다.