메뉴

#리더보드

HN
Hacker News • 2일 전
IMP 8

GPT-6 Astra, 자동차 주행 능력 획득

해커뉴스에 올라온 자율주행 리더보드에서 GPT-6 Astra(Codex·medium)가 3회 시도 중 2회째에 100% 코스 완주(5분 22초)를 달성하며 최상위를 기록했습니다. Claude Fable 5.1은 최고 45%, Grok 4.6은 11%, GPT-5.6 Sol은 6%에 그쳐 모델 간 실물 차량 제어 능력 격차가 뚜렷하게 드러났습니다.

GPT-6 자율주행 에이전트
HN
Hacker News • 33일 전
IMP 8

GLM-5.3, 오픈 웨이트 모델이 Anthropic·OpenAI 제치고 1/5 비용으로 1위

실무 과제 28개 기반 리더보드에서 오픈 웨이트 모델인 GLM-5.3이 코딩·데이터·실전·보안·툴 사용 등 5개 영역 모두 100% 통과율을 기록하며 최상위에 올랐습니다. 한 바퀴(랩)당 비용이 $0.28로 gpt-5.5($1.43)의 약 1/5 수준이며, 유일한 단점은 첫 토큰 지연시간(16.3초)입니다. 반면 fable-5는 28개 과제 중 5개를 거부해 79%로 공동 최하위에 그쳤습니다.

GLM 오픈소스 리더보드
MP
MarkTechPost • 39일 전
IMP 6

카르테시아, Sonic-3.6 공개 — 스피치 아레나 양대 리더보드 1위

Cartesia(카르테시아)가 트랜스포머가 아닌 상태 공간 모델(state space model) 기반의 스트리밍 TTS(텍스트 음성 변환) 모델 Sonic-3.6을 공개했습니다. 이 모델은 Artificial Analysis의 두 음성 리더보드에서 모두 1위를 차지했으며(Provider Voice 1,283 Elo, Controlled Voice 1,123 Elo), 첫 오디오 출력까지 90ms 미만의 지연 시간을 자랑합니다. 현재 Cartesia 자체 API에서 베타로 이용할 수 있습니다.

음성합성 TTS Cartesia
40
404 Media • 116일 전
IMP 8

직원들 반칙 속출에 아마존 내부 AI 리더보드 폐지

아마존이 직원들의 AI 도구 사용량에 따라 순위를 매기던 내부 리더보드를 폐지했습니다. 공식적으로는 사용 촉진이라는 목표를 달성했다고 밝혔으나, 실제로는 순위 조작을 위한 무의미한 AI 과소비 문제와 시스템의 허점이 원인으로 지목되고 있습니다. 이 사건은 단순한 사용량 지표가 아닌 실질적인 업무 효율성에 초점을 맞춰야 하는 기업 내 AI 도입의 한계를 보여줍니다.

아마존 AI 도입 생산성
OA
r/OpenAI • 163일 전
IMP 7

래더 역주행, 에이전트 최적화 모델

익명의 'Elephant-Alpha' 모델이 리더보드에서 빠르게 순위를 올리며 화제입니다. 저자는 이를 최근 에이전트 활용 사례(예: OpenClaw류)에 최적화된 오픈AI의 라이트 모델 라인 테스트로 추정합니다. 실무자 관점에서 주요 플랫폼이 실제 사용자 수요에 부합하는 에이전트 중심 모델로 전환하는 흐름을 보여준다는 점에서 주목할 만합니다.

오픈AI 에이전트 라이트모델