Grok 4.5, Fable 5·GPT 5.5 대비 압도적 저렴... 성능 격차 무의미?
xAI가 코드 및 에이전트 작업에 특화된 Grok 4.5를 공개했습니다. Fable 5나 GPT 5.5 같은 경쟁 모델들과 비교해 벤치마크 성능은 약간 뒤처지지만, 토큰당 가격과 사용량 측면에서 압도적인 비용 효율성을 자랑합니다. 뛰어난 가성비를 앞세워 최고 수준의 성능을 요구하지 않는 실무 환경에서 시장 점유율을 빠르게 확보할 것으로 보입니다.
xAI가 Grok 4.5를 출시했습니다. 이 모델은 수만 개의 엔비디아 GB300 GPU를 사용해 훈련되었으며 코딩, 에이전트 작업 및 지식 노동에 중점을 두고 있습니다. 벤치마크 결과는 엇갈립니다. 복잡한 명령줄 작업을 테스트하는 Terminal Bench 2.1에서 Grok 4.5는 83.3%를 기록하며 GPT 5.5(83.4%)와 거의 동일하고 Anthropic의 Fable 5(84.3%)에는 불과 1점 차이로 뒤처졌습니다. 하지만 다른 테스트에서는 격차가 커집니다. 실제 GitHub 이슈를 해결하는 능력을 측정하는 DeepSWE 1.1에서 Grok 4.5는 53%를 기록해 OpenAI의 GPT-5.5(67%)와 Fable 5(70%)에 크게 뒤처졌습니다. 더 어려운 소프트웨어 엔지니어링 문제로 구성된 SWE Bench Pro에서는 64.7%를 기록했는데, 특정 설정에서는 Opus 4.8(최대 설정 시 69.2%)보다 앞서지만 Fable 5의 80.4%에는 미치지 못합니다. xAI는 데이터 품질을 높게 유지하기 위해 훈련 과정에서 철저한 데이터 필터링, 중복 제거 및 도메인별 선택에 의존했다고 밝혔습니다. 강화 학습 단계는 주로 소프트웨어 엔지니어링 분야의 수십만 가지 작업을 다루며 자동화된 평가를 통해 진행되었습니다. 또한 xAI는 비동기식 학습을 위한 훈련 인프라를 구축하여 에이전트 작업이 여러 시간 동안 진행되는 동안에도 병렬로 훈련을 계속할 수 있도록 했습니다. Grok 4.5는 가격 경쟁력에서 압도적입니다. Grok 4.5는 백만 입력 토큰당 2달러, 백만 출력 토큰당 6달러입니다. 이는 이미 경쟁 모델들보다 훨씬 낮은 가격입니다. Opus 4.8은 백만 토큰당 입력 5달러, 출력 25달러입니다. Fable 5는 백만 토큰당 입력 10달러, 출력 50달러를 청구합니다. GPT-5.5 및 GPT-5.6은 입력 5달러, 출력 30달러 수준입니다. xAI는 또한 Grok 4.5가 SWE Bench Pro 작업에서 Opus 4.8보다 4.2배 적은 토큰을 사용하며 초당 80개의 토큰으로 결과를 제공한다고 밝혔습니다. 토큰당 단가가 낮고 작업당 토큰 사용량이 적기 때문에 이러한 성능 및 효율성 이점이 실제로 유지된다고 가정할 때, Grok 4.5는 동급의 성능을 가진 모델 중 단연코 가장 저렴한 선택지입니다. 이러한 가격 책정 전략은 중국 기반 업체인 지푸(Zhipu)나 딥시크(DeepSeek)가 해온 방식, 즉 성능은 근접하게 따라잡고 가격으로 승부하는 것과 같습니다. Grok 4.5는 현재 Grok Build, Cursor 및 xAI 콘솔을 통해 사용할 수 있습니다. 워드, 파워포인트, 엑셀용 플러그인도 출시되었습니다. 이 모델은 아직 EU에서는 사용할 수 없으며, xAI는 7월 중순 출시를 목표로 하고 있습니다. 참고로 xAI는 6월 중순 스페이스X가 600억 달러의 주식으로 인수한 코드 에디터 Cursor와 함께 Grok 4.5를 훈련했습니다.