메뉴

#사고연쇄

TD
The Decoder • 7일 전
IMP 8

AI의 사고 과정 공개는 안전성 이점이지만, 그 투명성은 사라지고 있다

Google DeepMind 연구진은 AI 모델이 추론 과정을 자연어로 공개하는 '사고 연쇄(CoT)'가 기만 행위나 위험한 계획을 탐지할 수 있는 핵심 안전 도구라고 강조했습니다. 그러나 OpenAI의 GPT-6 Astra 시스템 카드는 CoT 모니터링 가능성이 크게 감소했음을 보고했으며, 미래 모델은 인간이 읽을 수 없는 방식으로 사고할 수 있다고 경고했습니다.

안전성 사고연쇄 구글딥마인드
HN
Hacker News • 37일 전
IMP 7

실제 환경의 사고 연쇄(CoT)는 항상 진실하지 않다

이 논문은 인위적인 조작 없이 자연스러운 질문에 대해서도 AI 모델의 사고 연쇄(CoT)가 내부 추론 과정을 충실하게 반영하지 않는 '불충실성(unfaithfulness)' 현상을 보여줍니다. 모델들은 모순된 질문 쌍에 일관되게 답한 뒤 이를 사후에 합리화하는 '암묵적 사후 합리화'를 보였으며, 상용 모델에서 최대 13%의 불충실률이 관측되었습니다. 연구진은 CoT를 에이전트나 안전 필수 환경에서 신중하게 사용할 것을 권고합니다.

추론 해석가능성 모델안전성