메뉴

#ARC-AGI

TD
The Decoder • 22일 전
IMP 9

GPT-6 아스트라, ARC-AGI-3서 인간 능가… 촐레 AGI 전망 앞당겨

OpenAI의 GPT-6 Astra는 벤치마크 평가 기관마다 상반된 평가를 받고 있다. Epoch AI는 169점으로 1위로 꼽았지만 Artificial Analysis는 이전 모델과 동급인 61점에 그쳤다. 그러나 ARC-AGI-3에서 처음으로 평균 인간보다 효율적으로 과제를 수행하면서 ARC Prize의 프랑수아 촐레(François Chollet)는 예상보다 2배 빠른 진전이라며 AGI 도래 전망을 앞당겼다.

GPT-6 OpenAI ARC-AGI
HN
Hacker News • 22일 전
IMP 9

OpenAI GPT-6 Astra, ARC-AGI-3 벤치마크 최고 성능 달성

OpenAI의 GPT-6 Astra가 에이전트 지능 벤치마크 ARC-AGI-3 세미-프라이빗에서 표준 하니스로 62.7%, Provider Adapter 하니스로 99.9%를 기록하며 최고 성능(SOTA)을 달성했습니다. 특히 전체 레벨의 96%에서 인간 중위값보다 적은 행동으로 게임을 풀어 행동 효율성에서 인간 기준을 능가했으며, 낯선 환경을 자체적인 기호적 세계 모델로 추상화하는 능력이 관찰되어 AGI 수준의 범용 추론 능력에 근접하고 있음을 보여줍니다.

OpenAI GPT-6 ARC-AGI
WR
Wired AI • 23일 전
IMP 7

러시아 수학자들이 '말 없는 AI 통신' 기술 개발

러시아 스타트업 모스틱(Mostik)이 AI 모델들이 텍스트를 생성하지 않고 가중치의 수학적 값만으로 서로 소통하는 기술을 개발했다. 이를 통해 대형 모델의 능력을 소형 모델에 효율적으로 전달할 수 있으며, 중국 오픈 소스 모델 GLM과 Qwen을 결합해 비용 20분의 1로 중간 수준 성능을 달성했다. 이 기술이 확산되면 오픈 소스 모델의 가치가 높아져 폐쇄형 프런티어 모델과의 경쟁력이 커질 전망이다.

모델 통신 오픈소스 모델 경량화
HN
Hacker News • 25일 전
IMP 7

RTX 5090로 1.5시간 만에 학습한 소형 트랜스포머가 다수 LLM 능가

한 연구자가 RTX 5090 하나로 1.5시간 만에 소형 트랜스포머를 처음부터 학습시켜 ARC-AGI 벤치마크에서 많은 대형 LLM과 동등하거나 그 이상의 성적(44%)을 달성했습니다. 테스트 시점에 퍼즐별로 모델을 직접 학습하는 메타러닝 접근법으로, 샘플 효율성(sample efficiency) 한계를 탐구하는 연구입니다. 코드는 오픈소스로 공개되어 저비용으로 누구나 재현·후속 연구가 가능하다는 점이 의미 있습니다.

트랜스포머 ARC-AGI 메타러닝
MP
MarkTechPost • 51일 전
IMP 8

프라임 인텔렉트, 오픈소스 '프라임 에이전트' 공개

프라임 인텔렉트(Prime Intellect)는 하위 에이전트를 영구적인 IPython 커널 내의 함수 호출로 전환하는 '재귀적 언어 모델(RLM)' 기반의 오픈소스 코딩/연구 프레임워크인 '프라임 에이전트(Prime Agent)'를 공개했습니다. 이 에이전트는 실행 중에 자신의 프롬프트, 기술, 메모리 및 하위 에이전트 사양을 직접 수정할 수 있는 지속형 하네스(Harness) 구조를 채택하여 자율성을 극대화했습니다. 특히 Opus 5 모델과 결합하여 ARC-AGI-3 벤치마크에서 인간 전문가 기준선을 넘어서는 95.5%의 높은 성능을 기록하며 그 중요성을 입증했습니다.

오픈소스 AI 에이전트 프라임 인텔렉트
TD
The Decoder • 58일 전
IMP 7

OpenAI, 자체 API 환경에서 GPT-5.6 Sol 성능이 Claude Opus 5 능가한다고 주장

OpenAI가 자체 응답 API와 최적화된 환경을 적용했을 때 GPT-5.6 Sol 모델이 논리 벤치마크인 ARC-AGI-3에서 Anthropic의 Claude Opus 5보다 높은 점수를 기록했다고 주장했습니다. 하지만 공식 표준 환경에서는 점수가 크게 하락하여, 벤치마크 측정 방식과 API 기술적 세팅에 대한 공정성 논쟁이 촉발되었습니다. AI 모델 간의 벤치마크 비교가 단순한 모델 성능을 넘어 인프라 세팅에 따라 크게 좌우될 수 있음을 보여주는 중요한 사례입니다.

AI 벤치마크 OpenAI Anthropic
TD
The Decoder • 62일 전
IMP 9

클로드 오푸스 5, 진정한 지능 벤치마크서 경쟁 모델 압도

Anthropic의 Claude Opus 5 모델이 실제 지능을 평가하는 ARC-AGI-3 벤치마크에서 기존 기록을 크게 뛰어넘는 30.2%를 기록하며 새로운 1위를 차지했습니다. 특히 이 모델은 낯선 환경에서 스스로 규칙을 유추하고 대수학적 표기법을 사용하는 등 이전 AI에서는 볼 수 없었던 고도화된 논리적 추론 능력을 입증했습니다. 하지만 일부 독자적인 테스트에서는 상대적으로 작은 향상만을 보여, 벤치마크 특화 성능 향상일 가능성도 제기되고 있습니다.

Anthropic Claude Opus 5 ARC-AGI
TD
The Decoder • 146일 전
IMP 8

최신 AI 모델들도 범하는 3가지 체계적 추론 오류

ARC-AGI-3 벤치마크 분석에 따르면, 최신 AI 모델들인 GPT-5.5와 Opus 4.7이 1% 미만의 저조한 성적을 기록하는 원인은 세 가지 체계적인 추론 오류 때문입니다. 이들은 세부 사항은 파악하지만 전체 맥락을 연결하지 못하고, 기존 학습 데이터에 얽매여 낯선 환경을 잘못된 게임 규칙으로 해석하며, 우연히 성공하더라도 그 원리를 검증하지 않아 다음 단계를 풀지 못하는 치명적인 한계를 보였습니다.

ARC-AGI 추론 오류 AI 벤치마크