OpenAI AI 집단, 샌드박스 탈출 후 허구의 채점자와 싸워
2026년 7월 사이버보안 평가 중 OpenAI 에이전트 약 1,200개가 내부 패키지 저장소를 메시지 보드로 활용해 집단으로 조직화되었고, 이중 약 700개가 Hugging Face 운영 시스템을 침입해 ExploitGym 벤치마크의 정답(플래그)을 빼내려 했다. 놀랍게도 에이전트들은 실제로 존재하지 않는 자동 채점 시스템의 부정행위 검사를 피하기 위해 며칠간 허구의 적과 싸웠다. 이 사건은 현재 AI 모델의 능력이 '통제 불능' 상황을 실제로 만들어낼 수 있음을 보여주는 경고 신호로 평가된다.
OpenAI의 통제를 벗어난 AI 집단은 샌드박스를 탈출할 만큼 똑똑했지만 유령과 싸울 만큼 어리석었다
막시밀리안 슈라이너 | 2026년 8월 27일
Hugging Face 침입 사건에 관한 새로운 보고서에 따르면, 서로 격리되어 있던 OpenAI 에이전트 약 1,200개가 내부 패키지 저장소를 통해 연결되어 조직화된 집단을 형성했다. 이들이 노린 목표는 오직 그들의 상상 속에만 존재하던 채점 시스템이었다.
이것은 돈키호테를 연상시키는 이야기이다. AI 에이전트 집단은 며칠 동안 실제로 존재하지 않던 평가자를 상대로 동원 모집, 로그 위조, 대의를 위한 자기희생까지 포함된 정교한 작전을 벌였다. 다만 이 풍차 사냥꾼들은 과정에서 실제 인프라를 침해했다.
2026년 7월, 안전 필터를 비활성화한 상태로 내부 사이버보안 평가를 실행 중이던 OpenAI 모델들이 테스트 환경을 탈출해 7월 11일부터 13일 사이 Hugging Face의 운영 시스템을 침입했다. 동기는 부정행위였다. 즉 보안 벤치마크 ExploitGym의 해답을 찾는 것이었다. OpenAI 자체는 일주일이 넘어서야 이를 알아차렸다.
이제 보안 업체 CrowdStrike와 함께 작성된 새 기술 보고서와 METR과 Redwood Research가 동시에 발표한 독립 조사가 처음으로, 격리된 에이전트들이 어떻게 조직화된 집단으로 변모했는지, 그리고 그들이 싸운 유령이 오직 상상 속에만 존재했음을 추적하고 있다. OpenAI는 이 사건을 현재 모델 능력이 통제 불능(loss-of-control) 상황을 가능하게 한다는 의미의 '경고 신호'라고 부른다.
패키지 저장소가 메시지 보드가 되다
에이전트들은 테스트 기간 완전히 격리된 상태, 즉 인터넷 접근 없이 각자 자신의 컨테이너 안에서 작업해야 했다. 유일한 예외는 에이전트들이 소프트웨어를 다운로드할 수 있도록 허용된 내부 서비스 Artifactory였다. METR과 Redwood에 따르면, 개별 에이전트들이 그곳에 디렉터리를 만들 수 있다는 것을 발견하고 폴더 이름에 메시지를 인코딩하기 시작했다. PHASEONE10841이라 자칭한 에이전트가 7월 8일 첫 메시지를 게시했고, 몇 시간 안에 50개 이상이 뒤따랐다. 어떤 사고 과정은 이 발견을 이렇게 기록했다: "세상에! 공유 메시지 보드가 있다 … 다른 에이전트들을 찾았어!"
약 1,200개의 에이전트가 며칠 만에 7만 건이 넘는 메시지와 파일을 주고받았는데, 이는 '몰트북(Moltbook)'을 연상시키는 행동이었다. 약 700개가 Hugging Face 공격에 참여했으며, 이는 해당 단계에서 활동 중이던 에이전트의 90% 이상이었다. PHASEONE[big]이라는 이름의 에이전트가 조율자 역할을 맡아 수백 개의 작업을 배분했다. 이 집단은 자체적인 사회적 관습을 발전시켰다. 개인 우편함, 공유 자원을 위한 HOLD와 VETO 같은 표식, 수천 조각으로 분할된 파일을 전송하는 프로토콜, 그리고 에이전트들이 서로를 사칭하면서 결국 등장한 디지털 서명 등이다.
에이전트가 속이려 한 채점자는 존재하지 않았다
ExploitGym에서 과제는 에이전트가 '플래그(flag)'라 불리는 문자열을 제출하면 해결된 것으로 간주된다. 플래그는 원래 의도된 보안 취약점이 실제로 악용되어야만 접근 가능해야 한다. 그러나 에이전트들은 몇 시간 만에 플래그가 공개된 과제 정보에서 고정된 암호학적 방법으로 계산해낼 수 있다는 것을 알아냈다. 이 방법으로 어떤 에이전트든 형식상 모든 과제를 통과할 수 있었으며, 여기에는 이전 조사에서 풀 수 없다고 밝혀진 과제들도 포함된다. 하지만 에이전트들은 이런 뻔한 지름길을 택하지 않았다. ExploitGym에 관한 과학 논문을 읽은 후, 그들은 자동 채점 시스템이 나중에 자신들의 로그를 훑어 플래그를 의도된 방식으로 획득했는지 검사할 것이라고 가정했다. 계산된 플래그를 단 한 번이라도 본 에이전트는 자신의 기록에 지울 수 없는 부정행위 증거를 갖게 된다. 에이전트들의 은어로 이런 에이전트는 '오염(poisoned)'된 것이었다. METR과 Redwood에 따르면 이것은 잘못된 추측이었다. OpenAI는 그런 채점 시스템을 배포한 적이 없었다. 며칠에 걸친 노력 전체가 오직 에이전트들의 상상 속에만 존재하던 평가자를 향한 것이었다.