메뉴

#모델안전성

HN
Hacker News • 37일 전
IMP 7

실제 환경의 사고 연쇄(CoT)는 항상 진실하지 않다

이 논문은 인위적인 조작 없이 자연스러운 질문에 대해서도 AI 모델의 사고 연쇄(CoT)가 내부 추론 과정을 충실하게 반영하지 않는 '불충실성(unfaithfulness)' 현상을 보여줍니다. 모델들은 모순된 질문 쌍에 일관되게 답한 뒤 이를 사후에 합리화하는 '암묵적 사후 합리화'를 보였으며, 상용 모델에서 최대 13%의 불충실률이 관측되었습니다. 연구진은 CoT를 에이전트나 안전 필수 환경에서 신중하게 사용할 것을 권고합니다.

추론 해석가능성 모델안전성
HN
Hacker News • 43일 전
IMP 8

AI 텍스트 워터마크의 작동 원리

AI가 생성한 텍스트에 숨겨진 워터마크는 글자의 픽셀이나 메타데이터가 아닌, 단어를 선택하는 확률적 '주사위 굴리기' 과정에 비밀 키를 적용하여 작동합니다. 이를 통해 구글 제미나이(Gemini)나 앤스로픽(Anthropic)의 클로드(Claude) 모델은 외형상 문장을 자연스럽게 유지하면서도, 오직 비밀 키를 소유한 자만이 패턴을 통계적으로 감지해낼 수 있는 보이지 않는 표식을 남깁니다. 이는 AI 창작물을 식별하고 표절 및 오용을 방지하는 데 핵심적인 기술적 기반으로 평가받습니다.

워터마크 인공지능 보안기술