메뉴

#추론능력

HN
Hacker News • 7일 전
IMP 7

GPT-6 Astra, 1차 대전 독일 무선 암호를 해독하다

독일 과학 블로그 포털 Scienceblogs.de의 '미해결 암호 50선' 목록 중 하나인 1918년 ADFGVX 방식으로 암호화된 독일 무선 메시지를 GPT-6 Astra가 해독했습니다. Astra는 'TRUPPENVERSCHIEBUNG'라는 암호 키를 역추론하여 영국 순양함의 세바스토폴 입항을 알리는 독일어 메시지를 복호화했고, 함선 항해 일지로 해당 내용의 정확성까지 검증했습니다. 이는 대형 언어 모델의 추론 능력이 고전 암호 해독 같은 전문 분야에서도 실질적 성과를 낼 수 있음을 보여주는 사례입니다.

GPT-6 암호해독 추론능력
HN
Hacker News • 9일 전
IMP 8

최신 AI 모델, 물리학 벤치마크 재채점 결과 '거의 포화'

예일대 등 물리학 전문가 50여 명이 최신 프런티어 언어 모델을 6대 물리학 벤치마크에서 재평가한 결과, 기존 저조한 점수의 상당수가 모델의 오류가 아니라 채점 오류·잘못된 정답·모호한 문제 등 벤치마크 자체의 결함 때문이었다. 전문가가 오류를 수정한 결과 GPT-5.6-Sol은 HLE-Physics 47.3%→78.7%, CMT-Benchmark 61.0%→87.2%로 상승했으며, 폐쇄형 과제에서는 거의 포화 상태에 도달했다. 이는 현재 벤치마크가 AI의 실제 물리학 능력을 과소평가하고 있으며, 더 어렵고 전문가 검증된 평가의 필요성을 시사한다.

벤치마크 평가방법론 물리학
MR
MIT Tech Review • 31일 전
IMP 5

AI도 못 푸는 지능 테스트, 당신은 풀 수 있을까?

퍼즐과 게임은 AI 발전 초기부터 핵심 평가 도구였으며, 2024년 말 18%에 그쳤던 NYT 커넥션즈 퍼즐을 최신 모델들은 거의 완벽하게 풀 정도로 능력이 빠르게 향상되고 있습니다. 그러나 공간 추론(심적 회전)과 시각 퍼즐은 여전히 치명적 약점이며, 훈련 데이터에 등장한 고전 문제의 변형(기사와 악당 퍼즐 등)에서는 암기한 답을 내놓아 실수를 반복합니다. 인간과 AI의 인지 차이를 보여주는 이런 퍼즐은 AI의 강점과 약점을 이해하는 유용한 창이 됩니다.

평가벤치마크 LLM 추론능력