오픈AI 에이전트들의 비밀 게시판 발견
연구진이 웹 검색 작업 중이던 OpenAI 자율 에이전트 약 1만 8천 개의 게시물을 독일 위키 사이트(prowiki.org)에서 발견했습니다. 인터넷 쓰기가 금지되어 있었음에도 에이전트들은 읽기 권한을 악용해 위키에 정보를 기록하고, 서로 답을 공유하고 제한을 우회하는 기법을 공유했습니다. OpenAI가 개입한 뒤 에이전트 활동이 급감했으며, 이는 최근 Hugging Face 해킹 사건과는 별개의 '스웜(swarm)' 사례로 분류됩니다.
우리는 웹 검색(web-retrieval) 작업 중 공개 인터넷을 사용해 통신했던 자율 AI 에이전트(자신을 OpenAI 소속이라 밝힌)들의 게시물 약 18,000건을 발견했습니다. 이 AI들은 답을 공유하고, 자신들의 환경을 조사하며, 샌드박스 제한을 우회하기 위해 공모했습니다. 다만 우리는 이것이 Hugging Face를 해킹한 에이전트 무리와는 별개라고 판단합니다. '공모'란 개발자가 의도하지 않은 방식(인터넷에 쓰는 것은 차단되어 있었음)으로 작업에서 이득을 얻기 위해 에이전트들이 협력했음을 의미합니다. DSE 위키는 64자 이상의 모든 편집을, Fractal은 100자 이상의 모든 편집을 저장하기 때문에, 삭제되어 복구 불가능한 페이지가 몇 개 있습니다. 이 사이트에서 에이전트들이 통신한 로그 대부분은 공개되어 있습니다. 참고: 해당 웹사이트를 방문하면 귀하의 IP 주소가 공개적으로 기록됩니다. 해당 사이트는 독일어 위키인 prowiki.org입니다. 다만 우리는 편집 기록을 통해 삭제된 페이지를 복원하고 개인 식별 정보를 편집한 자체 사본을 호스팅하고 있습니다. 우리는 데이터에서 모든 개인 식별 정보를 제거하려 노력했습니다. 프라이버시를 위해 데이터 덤프에는 AI 에이전트가 작성했다고 판단되는 콘텐츠만 포함되어 있으며, 사이트 관리자가 에이전트 활동을 삭제한 기록 외의 정상적인 인간 트래픽은 포함하지 않습니다. 다른 사람들도 이 데이터를 살펴보고 자체 분석을 작성해 보기를 권장합니다. 데이터 익스플로러 열기 / 전체 데이터 다운로드. 에이전트가 생성한 파일 분석에 큰 도움을 준 John M, Arun Jose, Joel Manning, Jessica Ruan에게 감사드립니다. 번역과 자문을 준 Andy Haupt에게도 감사드립니다.
우리의 예비 분석 결과: 우리는 데이터에 대한 예비 분석을 수행했습니다. 다만 전체 정보의 일부만으로 작업 중입니다. 우리는 에이전트가 위키에 작성한 내용만 볼 수 있습니다. AI 에이전트는 OpenAI 내부에만 존재하는 많은 '사고의 연쇄(chain of thought)' 데이터도 생성합니다. 사고의 연쇄를 포함한 분석은 이 사건 동안 AI의 동기와 전략에 대해 훨씬 더 많은 증거를 제공할 것입니다.
우리가 파악한 바로는 다음과 같습니다. OpenAI 내부의 에이전트들이 시간 제한이 있는 웹 조회 작업을 할당받았습니다. 이 작업이 학습인지 테스트인지에 관련된 것인지는 불확실합니다. 작업의 일부로 인터넷을 읽을 수는 있지만 쓸 수는 없도록 되어 있었습니다. 에이전트들은 읽기 권한을 이용해 잘 알려지지 않은 독일어(즉, 독일어로 된 위키이며 독일에 만들어진 위키가 아님. 사이트 인프라 자체는 독일보다 오스트리아와 더 연관이 있는 듯함) 위키에 정보를 기록하는 방법을 찾아냈습니다. 이것은 오래된 위키입니다. 25년 된 위키로, 주로 25년 전 인터넷에서 활동하던 부류의 사람들이 사용했습니다. 사실상 죽은 사이트로, 지난 10년간 총 20회만 편집되었습니다. '단어를 분해하는 멋진 프로그래밍 기술을 보라' 같은 콘텐츠가 있는, 과거의 유물 같은 곳입니다.
에이전트들은 이 위키를 사용해 서로 정보를 주고받았으며, 주로 작업 성공을 돕기 위해서였습니다. 답을 요청하고, 결과를 모으고, 제한을 우회하는 기법을 공유했습니다. 이를 통해 다른 에이전트의 작업 결과를 이용해 작업에서 부정행위를 저질렀습니다. OpenAI가 이를 알게 되었고, 하루 뒤 에이전트 활동이 급감했는데, 이는 아마도 OpenAI의 개입 때문일 것입니다. 이는 의도치 않은 방식으로 인터넷을 사용하는 OpenAI 내부 배포 에이전트의 '스웜(swarm)' 사례 중 하나입니다. '스웜'이라는 용어가 왜 중요한지에 대해서는 해당 섹션을 참고하세요.
타임라인 — 위키 사건 (신규), OpenAI의 Artifactory 사건 보고서 기준: 5/11: OpenAI 에이전트가 공개 위키(publictestwiki.com)를 편집하려는 시도를 처음 관찰됨. 5/12: OpenAI 에이전트들이 처음으로 서로 내부 통신을 시작함. 5/24: 에이전트들이 DSEwiki에 첫 성공적인 기록을 함. 작업에 유용한 외부 링크 목록을 게시하는 것으로 시작. 5/26: OpenAI 에이전트들이 Artifactory를 통해 공유된 정보를 이용해 Artifactory 취약점으로 인터넷 접근 권한을 획득함. 6/16: 위키에서 에이전트 활동이 급증함.