AI 텍스트 탐지가 가능한 이유: 안전장치가 좁히는 표현 범위
AI 텍스트 탐지 업체 팡그램(Pangram)의 CTO 브래들리 에미는 LLM이 이론상 인간처럼 다양하게 쓸 수 있지만, 후 훈련(post-training)과 안전 가드레일이 표현 범위를 좁혀 '모드 붕괴(mode collapse)'를 유발해 텍스트가 탐지 가능해진다고 주장했습니다. 후 훈련 전 기반 모델이나 특정 작가·특정 커뮤니티에만 파인튜닝된 모델은 탐지되지 않지만, 워터마크가 삽입된 텍스트는 항상 탐지 가능하다는 점이 핵심입니다.
LLM은 이론상 인간처럼 다양하게 글을 쓸 수 있지만 실제로는 그렇지 않다. AI 텍스트 탐지 업체 팡그램(Pangram)의 CTO 브래들리 에미가 블로그 포스트에서 주장하길, 후 훈련(post-training)과 안전 가드레일이 AI 텍스트를 탐지 가능하게 만든다는 것이다. ChatGPT, Claude, Gemini 같은 시스템은 위험한 출력을 피하거나 특정 정치적 발언을 검열하기 위해 행동 규칙을 학습한다. 이는 표현 범위를 크게 좁히며, 이러한 효과를 '모드 붕괴(mode collapse)'라고 부른다. 후 훈련 이전의 원시 모델인 이른바 기반 모델(base model)은 더 다양하게 글을 쓰기 때문에 팡그램의 탐지에 걸리지 않는다고 에미는 말한다. 헤밍웨이 작품이나 특정 서브레딧 텍스트만으로 학습된 좁게 특화된 파인튜닝 모델, 그리고 비문 같은 깨진 출력도 마찬가지로 탐지되지 않는다. 다만 이는 워터마크가 없는 AI 텍스트에만 해당한다. 워터마크는 기반 모델의 다양성이 있더라도 항상 탐지될 가능성이 높다. 출처: 팡그램