LLM 지능 대비 비용 그래프의 오해와 진짜 비교
OpenTeams 엔지니어가 ArtificialAnalysis의 '지능 vs 비용' 그래프가 로그 스케일 사용, 공식 API 가격만 반영, 로컬 모델의 데이터센터 가격 표기 등으로 실제 비용 차이를 왜곡한다고 지적합니다. 저자는 선형 스케일과 실제 최저 임대 가격, 로컬 실행 전기요금을 반영한 자체 그래프를 공유하며, 단순 작업에 비싼 모델을 쓰는 것은 낭비임을 강조합니다.
OpenTeams 엔지니어가 ArtificialAnalysis의 '지능 vs 비용' 그래프가 로그 스케일 사용, 공식 API 가격만 반영, 로컬 모델의 데이터센터 가격 표기 등으로 실제 비용 차이를 왜곡한다고 지적합니다. 저자는 선형 스케일과 실제 최저 임대 가격, 로컬 실행 전기요금을 반영한 자체 그래프를 공유하며, 단순 작업에 비싼 모델을 쓰는 것은 낭비임을 강조합니다.
실무 과제 28개 기반 리더보드에서 오픈 웨이트 모델인 GLM-5.3이 코딩·데이터·실전·보안·툴 사용 등 5개 영역 모두 100% 통과율을 기록하며 최상위에 올랐습니다. 한 바퀴(랩)당 비용이 $0.28로 gpt-5.5($1.43)의 약 1/5 수준이며, 유일한 단점은 첫 토큰 지연시간(16.3초)입니다. 반면 fable-5는 28개 과제 중 5개를 거부해 79%로 공동 최하위에 그쳤습니다.
새 연구에 따르면 Sora, Genie 3 등 현존 월드 모델은 물리적 상태만 모델링할 뿐 사람의 믿음·의도·감정 등 정신적 상태를 반영하지 않아 다음 행동을 잘못 예측합니다. 연구진은 믿음, 주의, 목표, 감정, 사회적 관계 등 정신 변수를 통합한 'Mental World Modeling(MWM)' 프레임워크와 학습 없이 작동하는 참조 구현 MENTIS, 평가 데이터셋 Menti-Bench를 공개했으며, MWM 파이프라인 적용 시 F1 점수가 63.3에서 87.9로 상승했습니다.
이 글은 반도체 산업에 필수적인 고효율 3D 칩용 방열 유전체 신소재를 AI 에이전트가 발굴하는 연구 벤치마크를 소개합니다. 최신 LLM들이 안정성을 갖춘 500개 이상의 새로운 소재를 계산적으로 발견하는 데 성공했지만, 박막 증착 합성 경로를 제안하는 것은 매우 어려워 1개만이 실제 합성 가능한 것으로 확인되었습니다. 이는 AI가 이론적 신소재 설계를 넘어, 실제 실험실 구현 가능성을 고려하는 단계로 나아가야 하는 중요한 과제를 시사합니다.
한 개발자가 11개의 주요 대형 언어 모델(LLM)을 2D 배틀로얄 게임에 투입해 30판의 대결을 시켜보았습니다. 그 결과, 승리와 효율성에서는 엑스AI의 Grok이 압도했으나, 협력과 소통에서는 Anthropic의 Claude가 뛰어난 성능을 보였습니다. 이 실험은 기존의 정적인 AI 벤치마크가 실제 에이전트의 행동과 성향을 예측하는 데 한계가 있음을 보여줍니다.
ModelRift가 여러 AI 코딩 도구를 대상으로 텍스트 기반의 파라미터 3D 모델링 도구인 OpenSCAD를 사용해 판테온을 설계하는 벤치마크를 진행했습니다. 그 결과, 안티그래비티 2.0(Antigravity 2.0) 모델이 가장 뛰어난 공간 기하학 처리 및 건축적 디테일 구현 능력을 보여주며 1위를 차지했습니다. 이 벤치마크는 LLM이 복잡한 3D 형상을 얼마나 잘 코드로 변환하는지 평가하여, AI가 실제 CAD 및 3D 프린팅 워크플로우에 적용될 수 있는지를 보여준다는 점에서 중요합니다.
중국 스타트업 문샷AI(Moonshot AI)의 오픈웨이트 모델인 'Kimi K2.6'이 실시간 프로그래밍 및 퍼즐 대회에서 서구권 주요 AI 모델들을 제치고 압도적인 1위를 차지했습니다. 특히 2위 역시 중국 샤오미의 'MiMo V2-Pro'가 차지하며, 특정 과제에서 중국산 AI 모델들의 코딩 및 전략적 추론 능력이 글로벌 최고 수준에 도달했음을 보여주었습니다.