메뉴

#해석가능성

HN
Hacker News 2일 전
IMP 8

‘진리’를 향할 수 없는 LLM: 타르스키 대각선 공격

최근 AI 안전성 연구에서 LLM의 임베딩 공간 내에 '진리' 방향이 존재하여 모델의 거짓말을 탐지할 수 있을 것이라는 기대가 컸습니다. 그러나 이 글은 '이 문장은 거짓이다'와 같은 자기참조적 역설을 활용한 대각선 공격을 통해 어떤 탐지기도 완벽하게 진리를 특정할 수 없음을 증명합니다. 이는 AI 정렬 및 해석 가능성 연구에서 기하학적·선형적 방식의 한계를 명확히 보여주는 중요한 이론적 통찰입니다.

인공지능 안전성 해석가능성 대형언어모델
HN
Hacker News 56일 전
IMP 9

LLM은 더 이상 미지의 블랙박스가 아닙니다

LLM의 내부 작동 원리를 역설계하여 모델이 실제로 '생각'하는 과정을 추적하는 '기계적 해석 가능성(Mechanistic interpretability)' 연구가 큰 진전을 보이고 있습니다. 최근 Anthropic의 연구에 따르면 LLM은 인간이 이해할 수 있는 고수준의 개념들을 통해 실제로 다단계 추론을 수행하며, 고유의 '잠재의식' 과정을 거치는 것으로 밝혀졌습니다. 이는 AI의 오작동을 방지하고 성능을 향상시키는 핵심 기반이 될 수 있어 매우 중요한 의미를 갖습니다.

해석가능성 LLM Anthropic