메뉴

#KAIST

TD
The Decoder • 14일 전
IMP 7

AI 모델의 추론 단계, 내부 표현에서도 뚜렷이 구분된다

KAIST와 네이버 AI랩 연구진이 언어모델의 수학 문제 풀이 과정을 8가지 추론 연산으로 분류한 결과, 표면적 단어 선택이나 위치가 아니라 모델 내부 표현(특히 중간 층)에서 추론 단계 유형이 명확히 구분됨을 확인했습니다. 같은 단어도 속한 추론 단계에 따라 내부 표현이 달라지고, 오답인 경우에도 수행 중인 단계 유형은 식별 가능했습니다. 이는 사고연쇄(CoT) 감시라는 AI 안전성 과제와 직결되는 중요한 연구입니다.

추론 해석가능성 KAIST