메뉴

#ARC-AGI-3

TD
The Decoder • 8일 전
IMP 8

GPT-6 Astra, 포켓몬 챔피언 18시간 달성…크리퍼 사고 후 감자 농사

OpenAI의 GPT-6 Astra가 포켓몬 파이어레드를 18시간 만에 클리어하는 등 이전 모델들이 실패한 게임들을 잇달아 정복했습니다. 특히 마인크래프트에서는 엔더의 눈 재료까지 모았으나 크리퍼 폭발로 창고가 날아간 뒤 몇 시간 동안 감자 농사만 짓는 해프닝도 벌어졌습니다. ARC-AGI-3 벤치마크에서도 62.7%를 기록하며 GPT-5.6 대비 큰 도약을 보여주었습니다.

GPT-6 게이ming AI ARC-AGI-3
TC
TechCrunch AI • 35일 전
IMP 8

엔비디아 연구: AI 에이전트의 진짜 핵심은 모델이 아닌 '하니스'

엔비디아 연구진이 메모리 관리와 '슈퍼바이저' 구성요소가 포함된 커스텀 하니스를 사용해 Claude Opus 5를 ARC-AGI-3 벤치마크에서 100% 점수를 달성했다고 발표했다. 하니스 없이는 최고 모델도 30%에 그쳤으며, 이는 에이전트 시스템에서 모델 선택만큼 모델을 둘러싼 도구·런타임·메모리 체계가 결정적임을 보여준다. 오픈AI도 하니스 설정 조정만으로 점수를 3배 끌어올린 바 있어, 장기 과업 수행에서 하니스 설계의 중요성이 커지고 있다.

엔비디아 에이전트 하니스
SG
r/singularity • 147일 전
IMP 8

ARC-AGI-3 벤치마크 업데이트 (GPT-5.5, 오푸스 4.7)

최신 AI 모델들의 추론 능력을 평가하는 난이도 높은 벤치마크인 ARC-AGI-3에서 GPT-5.5가 0.43%, 오푸스(Opus) 4.7이 0.18%의 매우 낮은 성적을 기록했습니다. 이는 해당 테스트가 현재 AI의 한계를 시험하는 매우 까다로운 과제임을 보여줍니다. 업계에서는 과연 어떤 모델이 이 벽을 깨고 문제를 풀어낼지 큰 관심을 보이고 있습니다.

ARC-AGI-3 GPT-5.5 오푸스 4.7