GPT-6 Astra, 자동차 주행 능력 획득
해커뉴스에 올라온 자율주행 리더보드에서 GPT-6 Astra(Codex·medium)가 3회 시도 중 2회째에 100% 코스 완주(5분 22초)를 달성하며 최상위를 기록했습니다. Claude Fable 5.1은 최고 45%, Grok 4.6은 11%, GPT-5.6 Sol은 6%에 그쳐 모델 간 실물 차량 제어 능력 격차가 뚜렷하게 드러났습니다.
해커뉴스에 올라온 자율주행 리더보드에서 GPT-6 Astra(Codex·medium)가 3회 시도 중 2회째에 100% 코스 완주(5분 22초)를 달성하며 최상위를 기록했습니다. Claude Fable 5.1은 최고 45%, Grok 4.6은 11%, GPT-5.6 Sol은 6%에 그쳐 모델 간 실물 차량 제어 능력 격차가 뚜렷하게 드러났습니다.
실무 과제 28개 기반 리더보드에서 오픈 웨이트 모델인 GLM-5.3이 코딩·데이터·실전·보안·툴 사용 등 5개 영역 모두 100% 통과율을 기록하며 최상위에 올랐습니다. 한 바퀴(랩)당 비용이 $0.28로 gpt-5.5($1.43)의 약 1/5 수준이며, 유일한 단점은 첫 토큰 지연시간(16.3초)입니다. 반면 fable-5는 28개 과제 중 5개를 거부해 79%로 공동 최하위에 그쳤습니다.
Cartesia(카르테시아)가 트랜스포머가 아닌 상태 공간 모델(state space model) 기반의 스트리밍 TTS(텍스트 음성 변환) 모델 Sonic-3.6을 공개했습니다. 이 모델은 Artificial Analysis의 두 음성 리더보드에서 모두 1위를 차지했으며(Provider Voice 1,283 Elo, Controlled Voice 1,123 Elo), 첫 오디오 출력까지 90ms 미만의 지연 시간을 자랑합니다. 현재 Cartesia 자체 API에서 베타로 이용할 수 있습니다.
아마존이 직원들의 AI 도구 사용량에 따라 순위를 매기던 내부 리더보드를 폐지했습니다. 공식적으로는 사용 촉진이라는 목표를 달성했다고 밝혔으나, 실제로는 순위 조작을 위한 무의미한 AI 과소비 문제와 시스템의 허점이 원인으로 지목되고 있습니다. 이 사건은 단순한 사용량 지표가 아닌 실질적인 업무 효율성에 초점을 맞춰야 하는 기업 내 AI 도입의 한계를 보여줍니다.
익명의 'Elephant-Alpha' 모델이 리더보드에서 빠르게 순위를 올리며 화제입니다. 저자는 이를 최근 에이전트 활용 사례(예: OpenClaw류)에 최적화된 오픈AI의 라이트 모델 라인 테스트로 추정합니다. 실무자 관점에서 주요 플랫폼이 실제 사용자 수요에 부합하는 에이전트 중심 모델로 전환하는 흐름을 보여준다는 점에서 주목할 만합니다.