팬그램 AI 탐지 점수가 공개 망신 주기로 변질되는 문제
AI 텍스트 탐지 기업 팬그램(Pangram)이 저널리스트를 고용해 SNS 사용자들의 AI 사용을 공개적으로 비난한 사건과, 그 이후에도 CEO가 점수로 사람들을 지목하는 행태를 다룬 글입니다. 핵심 문제는 탐지 점수가 'AI 사용 여부'만 측정할 뿐 '어떻게 사용했는지', 즉 저자의 사고와 노력은 판단하지 못한다는 점입니다. 저자 자신의 AI 번역+수정 글도 28% AI로 판정받는 사례를 들며, 점수 기반 낙인이 학계 등에서 부작용을 일으킬 수 있음을 경고합니다.
팬그램(Pangram)의 가장 큰 결함은 사용자들이 점수를 공개 망신 주기로 활용한다는 점이다.
핵심 요점:
- AI 텍스트 탐지 기업 팬그램이 저널리스트를 고용해 AI를 사용하는 SNS 사용자들을 공개적으로 망신 줬다.
- 회사는 이후 그와 손을 끊었지만, CEO 맥스 스페로(Max Spero)는 팬그램 점수를 근거로 SNS에서 AI 사용 의혹을 지속적으로 지목하고 있다.
- 팬그램은 'AI가 관여했는지'만 측정할 뿐인데, 망신 주기는 '그 사람이 스스로 생각하고 작업하지 않았다'는 것을 암시한다. 이는 전혀 다른 두 가지 문제다.
팬그램은 사람들을 망신 주는 '공격견'을 고용했다. 이 과정에서 두 질문이 뒤섞인다: AI가 사용되었는가, 그리고 어떻게 사용되었는가. 'AI 사냥꾼'들은 대상이 스스로 생각하거나 작업하지 않았다고 비난하는데, 이는 '어떻게'에 관한 주장이다. 하지만 그들의 도구는 (대략적으로) '여부'만 측정한다.
WIRED에 따르면, 저널리스트 로드 브레슬라우(Rod Breslau)는 SNS에서 AI 생성 콘텐츠를 보는 데 지쳐 올해 초 팬그램 창업자 스페로에게 자신의 서비스를 제안했다. 브레슬라우는 팬그램에 SNS 전략 자문을 하면서 동시에 AI 사용 의심자들을 사냥했다. 브레슬라우는 WIRED에 "사람들이 너무 쉽게 넘어가고 있다고 생각해서 더 강경한 접근을 원했다"고 말했다.
브레슬라우의 캠페인 논리는 그의 의견이다. 그는 GamesBeat와의 인터뷰에서 "모두가 자기 분야의 리더를 자처하며 트위터와 링크드인에서 그것을 중심으로 개인 브랜드를 쌓는다. 임원, 테크 CEO까지 포함해서 말이다. 그런 사람이라면 직접 글을 써야 한다. 직접 쓰지 않는다면 나나 다른 사람들이 놀려도 된다"고 말했다.
팬그램은 방향을 바꾸면서 이후 그와 관계를 끊었다. 스페로는 WIRED에 AI 사용이 점점 수용되는 추세라고 보고, 가벼운 AI 편집까지 탐지하려 하며, 출판·교육 등에서 원작성 검증의 최고 권위자로 자리매김하려 한다고 밝혔다. 하지만 브레슬라우와 결별한 후에도 CEO 맥스 스페로는 팬그램 결과를 근거로 사람들에게 점수를 매기고 공개 지목하는 일을 계속하고 있다. 그의 표현대로라면 AI 사용을 숨기려 한 사람들에게 책임을 묻는 것이다.
팬그램의 비즈니스 모델은 사람들이 AI 사용을 게으름이나 부정직과 동일시하는 데 의존한다. 그런 낙인이 사라지면 탐지 서비스에 돈을 낼 이유가 줄어들기 때문이다.
팬그램은 'AI 관여'를 탐지하지, 'AI 저작'을 탐지하지 않는다
하지만 어떤 탐지 점수도 — 설령 완벽히 정확하더라도 (그리고 내 테스트 결과 팬그램은 종종 그렇지 않다) — AI가 관여했을 가능성만 보여줄 뿐이다. 프롬프트로 전체 텍스트를 생성했는가? AI가 사고 파트너 역할을 했는가? 표현을 다듬는 데 도움을 받았는가? 저자가 자신의 글을 다듬거나 번역하려고 AI에 통과시켰을 뿐인가? 점수는 알 수 없다.
그런데 '팬그램 망신 주기'는 AI가 조금이라도 관여하면 저자가 생각하지 않았거나 신경 쓰지 않았다는 뜻이라고 받아들인다. 높은 점수는 10초 만에 프롬프트로 만들어진 텍스트뿐 아니라, 독창적 연구와 논증으로 수 시간을 채운 텍스트에도 똑같이 매질 수 있다. 팬그램은 그 차이를 구별하지 못한다. 그러려면 작성 과정을 지켜봤어야 한다.
실제 사례: 지금 읽고 있는 이 글의 영어 버전은 내 독일어 원문의 번역으로, AI로 초안을 작성한 후 직접 그리고 AI로 편집했다. 팬그램은 이 글에 "28% AI" 점수를 매기며 마지막 문단을 AI 작성으로 표시했다. 하지만 모든 섹션은 같은 방식으로 작성·편집됐고, AI 관여 정도도 비슷했으며 인간의 의도는 분명히 같았다.
브레슬라우나 스페로 같은 자칭 AI 경찰은 그 점수를 근거로 마지막 문단이 AI에서 나왔고 내 생각이 반영되지 않았다고 주장할 것이다. 더 심각한 건, 학계에서 이런 백분율 점수를 근거로 논문을 거부하는 일이 벌어진다는 점이다. 그 논문들 상당수는 제2언어로 글을 쓰는 연구자들, 혹은 글쓰기보다 과학에 더 뛰어난 연구자들이 AI를 활용해 쓴 것들이다.