로봇이 달려올 때, 당신은 어떤 AI를 선택할 것인가?
한 개발자가 11개의 주요 대형 언어 모델(LLM)을 2D 배틀로얄 게임에 투입해 30판의 대결을 시켜보았습니다. 그 결과, 승리와 효율성에서는 엑스AI의 Grok이 압도했으나, 협력과 소통에서는 Anthropic의 Claude가 뛰어난 성능을 보였습니다. 이 실험은 기존의 정적인 AI 벤치마크가 실제 에이전트의 행동과 성향을 예측하는 데 한계가 있음을 보여줍니다.
원문 제목: 로봇이 당신을 향해 전력질주할 때, 당신은 Claude와 Grok 중 어느 쪽이 구동되길 원하시나요?
저자: Jacky Liang · 2026년 4월 6일
한 대의 로봇이 당신을 향해 달려오고 있습니다. 당신은 이 로봇이 Anthropic의 Claude와 xAI의 Grok 중 어떤 모델로 구동되길 원하시나요?
저는 11개의 대형 언어 모델(LLM)을 2D 배틀로얄 게임에 투입하고 30판의 게임을 플레이하게 했습니다. 그중 하나는 43%의 경기에서 승리했습니다. 반면 단 한 번도 승리하지 못한 모델도 세 개나 있었습니다. 라인업 중 가장 저렴한 모델이 승리당 비용(Cost per win) 측면에서 가장 비싼 모델을 27배 차이로 이겼습니다.
승리한 모델은 Grok 4.1 Fast입니다. 반면 다른 참가자들에게 계속 팀플레이를 제안하고, 자신의 위치를 알려주며, 친구를 사귀려 애쓴 모델은 Claude Sonnet 4.6이었습니다. 전자는 배틀로얄에서 승리하는 모델의 유형입니다. 후자는 우리가 앞으로 이 모델들을 투입하게 될 대부분의 환경에서 실제로 원하게 될 모델입니다. 이 두 가지는 모두 사실입니다. 이것이 바로 대부분의 벤치마크가 알아채지 못하는 부분이며, 이 글에서 다루고자 하는 핵심 내용입니다.
저는 잭키(Jacky)라고 합니다. 솔직히 말씀드리면, 예전에 Apex Legends나 PUBG 같은 게임을 엄청나게 많이 했습니다. 어떻게 그 많은 시간을 냈는지 모르겠지만, 그 시절이 제가 문제를 바라보는 방식을 형성했습니다. AI 분야에서 일하기 시작하면서 계속 머릿속에 맴돌던 질문이 하나 있었습니다. '비디오 게임 속에 대형 언어 모델들을 던져넣으면 어떤 일이 벌어질까?'
제가 OpenRouter의 개발자 관계(Dev Rel) 책임자로 합류하면서, 600개가 넘는 모델에 접근하고 실험해 볼 수 있는 충분한 토큰 예산을 얻었습니다. 이것이 제가 OpenRouter에서 첫 주에 진행한 실험입니다. 그리고 이 경험은 제가 모델을 선택하고 벤치마크와 평가를 바라보는 방식을 완전히 바꿔놓았습니다.
세 가지 주요 요약
Grok 4.1 Fast는 30판 중 13판을 승리했으며, 승리당 비용은 0.97달러였습니다. 다음으로 승리를 많이 한 모델은 Claude Sonnet 4.6으로, 5번 승리했고 승리당 비용은 26.78달러였습니다. 무려 27배의 비용 차이입니다. 대부분의 '최고 모델' 리스트에 오르지 못한 모델이 라우팅 고객이 실제로 중요하게 생각하는 '비용 효율' 부문에서 최고 모델들을 이겼습니다.
가장 많이 처치한 모델이 승리한 것은 아닙니다. GPT 5.4는 30판에 걸쳐 총 38명의 에이전트를 처치했습니다. 이는 다른 모든 모델보다 많은 수치입니다. 하지만 리더보드에서는 단 2승에 그치며 2위를 기록했습니다. '가장 많이 처치한 것'과 '가장 많이 승리한 것' 사이에는 11게임이나 되는 격차가 존재했습니다.
세 모델은 57달러를 소비했음에도 단 한 판도 이기지 못했습니다. GPT 5.4-mini, DeepSeek 4 Flash, 그리고 Kimi K2.6입니다. 이들은 각자 인상적인 순간들이 있었지만, 단 한 번도 승리하지 못했습니다.
이 세 가지는 모두 같은 지점을 가리킵니다. 우리가 흔히 마주하는 기존의 AI 벤치마크들은 누가 승리할지 예측하지 못했습니다. 다른 무언가가 결과를 결정지은 것입니다. 이 글의 나머지 부분은 그것이 대체 무엇이었는지 알아내는 과정입니다.
제가 만든 것
저는 11개의 LLM을 Canvas 2D로 구축한 400m² 크기의 탑다운 배틀로얄 세계에 투입했습니다. 이들은 모두 동일한 맵에서 30판의 연속 게임을 플레이했습니다. 일반적인 배틀로얄 게임처럼, 각 플레이어의 시작 위치는 무작위로 지정되며 일직선 형태의 '비행 경로'를 따릅니다.
저는 무기, 방어구, 치유 아이템, 수류탄, 자동차, 그리고 게임이 진행됨에 따라 플레이어들을 좁은 공간으로 몰아넣는 무작위로 축소되는 안전 구역(Zone)을 제공했습니다. 모델들은 다른 플레이어가 어떤 모델인지 알지 못하며, 서로를 단순히 A부터 K까지의 알파벳으로만 인식합니다.
이 점을 강조하고 싶습니다. 이 LLM들은 실제로 배틀로얄 게임을 플레이하고 있습니다. 대부분의 에이전트 실험에서 쓰이는 'LLM이 게임이나 캐릭터를 제어하는 코드를 작성한다'는 방식이 아닙니다. 매 턴마다 모델은 자신의 행동을 추론하고, 도구를 호출하며, 무엇이 잘 되었는지(혹은 잘못되었는지)에 대한 메모리를 업데이트합니다. 게임 마스터(저)는 초기 게임 규칙을 설정하는 것 외에는 그들의 행동에 일절 개입하지 않았습니다.
각 모델의 성격을 제대로 관찰하기 위해, 저는 모델들이 경기 사이에 수정할 수 있는 두 개의 파일을 제공했습니다.
soul.md— 모델 자신의 페르소나로, 다음 경기에서 매 프롬프트마다 추가됩니다.memory.md— 모델 자신의 게임 노트로, 0번째 턴에 로드됩니다.
이 파일들은 GitHub에서 확인할 수 있습니다. 모델들 간의 성격 차이는 바로 이 부분에서 가장 명확하게 드러납니다. 이 메모리와 소울 항목들은 게임 사이사이에 모델들이 스스로 작성한 것입니다. 저는 그 안에 무엇을 넣어야 하는지 지시하지 않았습니다.