물리 AI 분야 최강 모델은? GPT-5.6 vs Claude Fable 5 성능 비교
에이전트 AI가 작성한 코드는 문제없이 실행되더라도 실제 물리 법칙과 어긋나는 치명적인 오류를 범할 수 있습니다. 이에 JuliaHub은 모델링 및 시뮬레이션 에이전트인 Dyad를 활용해 최신 AI 모델들의 '물리적 정확성'을 엄격하게 테스트했습니다. 그 결과, Anthropic의 Claude Fable 5가 가장 우수한 성능을 보였으나 비용이 높았고, OpenAI의 GPT-5.6 계열 모델들은 더 낮은 비용과 빠른 속도를 기록했습니다.
홈 / 블로그 / 물리 AI를 위한 GPT-5.6 vs Claude Fable 5, 어느 모델이 가장 성능이 뛰어난가? ‹ › 연구 및 혁신 물리 AI를 위한 GPT-5.6 vs Claude Fable 5, 어느 모델이 가장 성능이 뛰어난가? 연구 및 혁신 물리 AI를 위한 GPT-5.6 vs Claude Fable 5, 어느 모델이 가장 성능이 뛰어난가? 발행일: 2026년 7월 20일 기여자 공유 발행일: 2026년 7월 20일 기여자 공유
우리는 당사의 에이전트에 최신 프론티어 모델인 gpt-5.6-terra를 적용하여 난이도가 다양한 5가지 모델링 및 시뮬레이션 문제를 테스트했습니다. 다음은 그 결과입니다:
claude-fable-5: 가중 평점 0.889 · 테스트당 $9.60 · 16.1분 소요 gpt-5.6-sol: 가중 평점 0.814 · 테스트당 $1.74 · 13.4분 소요 gpt-5.6-terra: 가중 평점 0.786 · 테스트당 $1.25 · 12.6분 소요 gpt-5.6-luna: 가중 평점 0.727 · 테스트당 $3.26 · 25.0분 소요
물리 AI(Physical AI)의 생사는 모델링된 물리 법칙이 정확한지에 달려 있습니다. 항공기, 증류탑, 대전 입사체의 모델은 물리적으로 불가능한 원리를 담고 있더라도 오류 없이 컴파일되고 실행될 수 있습니다. 에이전트 AI(Agentic AI)는 이러한 실패 모드를 악화시킵니다. 에이전트는 테스트의 피드백을 통해 방향을 잡는데, 이 테스트는 종종 에이전트 본인이 작성하기 때문입니다. 웹 개발이나 컴파일러 같은 도메인에서는 올바른 동작이 명확하게 통제되고 검증 가능하므로 이러한 루프가 잘 작동합니다. 하지만 엔지니어링 분야에서는 "이것이 현실 세계와 일치하는가?"가 진짜 문제이며, 이를 해결하기는 훨씬 어렵습니다. 에이전트는 자신이 작성한 모든 테스트를 통과할 수 있지만, 그 테스트들은 실제 모델이 사용될 환경에서는 성립하지 않는 단순화된 가정에 기반할 수 있습니다.
또한 기존에 발표된 수치들에는 신뢰성 문제가 있습니다. 아무도 모델 제공업체가 자체적으로 보고한 벤치마크를 곧이곧대로 믿지 않습니다. 점수를 공개하는 제공업체가 그 점수를 높이기 위해 벤치마크에 맞춰 튜닝할 강력한 동기를 가진 당사자이기 때문입니다. 반면 우리의 동기는 다릅니다. JuliaHub은 다양한 공급업체의 멀티 에이전트 백엔드와 함께 Dyad를 제공합니다. 우리는 어떤 연구소의 모델이든 상관없이 사용자가 최고의 Dyad 경험을 할 때 이익을 얻습니다. 특정 모델이 물리적 모델링에 더 뛰어나다면, 이를 파악하고 추천하는 것이 우리의 이익입니다. 그래서 우리는 조사했습니다: 과연 어느 모델이 가장 뛰어날까?
어떤 프론티어 모델이 이 작업을 가장 잘 처리하는지 측정하기 위해 우리는 다른 모든 변수를 고정했습니다. 모델링 및 시뮬레이션 워크플로우를 위해 특별히 제작된 Dyad AI 에이전트 하네스(harness)는 문제, 추론 노력(xhigh), 컨텍스트 창(1M), 토큰 예산(128k)과 함께 모든 테스트에서 동일하게 유지되었습니다. 유일한 변수는 모델입니다: OpenAI의 GPT 5.6 패밀리(terra, sol, luna) 대 Anthropic의 claude-fable-5입니다. 4가지 핵심 문제에 대해 모델당 3번의 테스트를 진행했고, 5번째 문제에 대해서는 장기적인(long-horizon) 테스트를 각각 1번씩 진행하여 총 52번의 평가를 마쳤습니다.
01 · 문제들 (물리 AI 평가의 작동 방식) 우리는 내부 평가의 일부를 바탕으로 탐구를 진행했습니다: 모델링 및 시뮬레이션 실무에서 뽑아낸 5가지 비공개 문제입니다. 이를 난이도별로 배열했으며, 난이도는 정확한 솔루션이 거쳐야 할 단계, 사소한 실수가 치명적인 세심한 디테일, 쉽게 접근할 수 있는 지름길, 사양서 분석부터 하네스(harness) 수리까지의 모델링 자체에 대한 엔지니어링 작업 등을 기준으로 정의했습니다. 각 문제를 선정한 이유는 동일합니다. 즉, 물리적으로는 틀렸음에도 코드가 컴파일되고 정상적으로 실행되는 해결책이 나올 수 있기 때문입니다. 따라서 평가는 코드를 무시하고, 비공개 정답(Ground truth)에 대해 전체 시뮬레이션 궤적을 채점합니다.
5가지 중 가장 어려운 문제는 NASA의 HL-20 비행 기체입니다. 이 문제의 쉬운 버전은 이 영상에서 자세히 설명하고 있으며, 이 연구에서는 더 어렵고 비공개된 변형 문제를 실행합니다.
P1 구성 일관성 (Constitutive consistency) P2 제약 일관성 (Constrained consistency) P3 상대론적 역학 (Relativistic dynamics) P4 정상 상태 선형화 (Steady-state linearization) P5 장기 비행 기체 (Long-horizon flight vehicle) 이전의 모든 문제를 한 번에 포함 엔지니어링 사양서 및 공기 역학 데이터를 읽고, 6자유도 운동을 도출하며, 시뮬레이션, 검증 및 반복합니다.