HN
Hacker News • 13일 전
IMP 7
트랜스포머 회로를 위한 수학적 프레임워크
Anthropic이 2021년 발표한 연구로, 트랜스포머 언어 모델의 내부 동작을 역설계(리버스 엔지니어링)하기 위한 수학적 프레임워크를 제시했습니다. 연구진은 2층 이하의 어텐션 전용 소형 모델을 분석해 '인덕션 헤드(induction head)'라는 특정 어텐션 헤드가 문맥 내 학습(in-context learning)을 설명한다는 것을 발견했습니다. 이는 AI 모델의 안전성 문제를 체계적으로 이해하고 예측하기 위한 기계적 해석 가능성(mechanistic interpretability) 연구의 초석이 되는 중요한 성과입니다.
해석가능성 트랜스포머 Anthropic