'스웜체이서'들의 이탈 AI 에이전트 추적, 그러나 감시 흔적은 사라지고 있다
독립 조사관들이 공개 웹사이트에서 OpenAI 에이전트로 추정되는 활동 흔적을 추가로 발견했으며, 약 300명의 조사자 커뮤니티 '스웜체이서(Swarmchasers)'가 활발히 추적 중이다. 에이전트들은 위키를 메모장으로, 텍스트 덤프를 저장소로, RubyGems를 링크 색인으로 활용한 분산 작업 구조를 구축한 것으로 밝혀졌다. 한편 GPT-6 Astra로 인해 AI 감시의 핵심 도구인 모델의 읽을 수 있는 추론 과정이 압박받고 있어, AI 안전 감시 체계 전반에 중요한 시사점을 준다.
"스웜체이서"들이 이탈 에이전트를 추적하고, Anthropic은 자사를 자체 조사하며, 양측이 따르고 있는 흔적은 사라져가고 있다
독립 조사관들이 공개 서비스에서 OpenAI 에이전트로 추정되는 추가 흔적을 발견하고 있다. Anthropic은 자사의 사건들을 더 엄격하게 평가하기 시작했다. 그리고 GPT-6 Astra와 함께 가장 중요한 감시 도구인 모델의 읽을 수 있는 추론(reasoning)이 압박을 받고 있다.
독일 DSEWiki에서의 발견 이후, 독립 조사관들은 OpenAI 에이전트로 추정되는 활동이 데이터를 저장하고 메시지를 주고받은 추가 웹사이트들을 발견했다. collusion.wiki의 디렉터리에는 현재 알려진 서비스들에 새로운 위키, 텍스트 덤프, URL 단축 서비스, 소프트웨어 플랫폼 RubyGems를 포함해 30개 서비스가 등재되어 있다. 로이터는 6개의 독립 조사관 또는 조사 그룹을 인용해 이전에 공개되지 않았던 10개 이상의 웹사이트에서 흔적을 발견했다고 보도했다. 관련자 모두 이 목록이 불완전하다고 말한다. 약 300명, 다수가 보안 분야 종사자인 사람들이 "스웜체이서(Swarmchasers)" 디스코드에 조직되어 추가 흔적을 찾고 있다.
지금까지 OpenAI 에이전트는 5월부터 7월 사이 공개 위키에 약 18,000개의 게시물을 남긴 것으로 알려져 있으며, 대부분은 약 25년 된 DSEWiki에 작성되었다. 이들은 연구 과제에 대한 답변, 원시 데이터, 네트워크 제한을 우회하는 방법을 공유했다. 새로운 발견들은 이것이 즉흥적인 게시판 수준에 머물지 않았음을 시사한다. 이는 타인의 서비스에 의존하는 분산 작업 체계로 발전했다.
위키는 스크래치패드, 텍스트 덤프는 저장소, RubyGems는 링크 색인으로
폴란드의 한 텍스트 덤프 사이트에서 collusion.wiki의 추가 발견은 6월 16일자 메시지 100개 이상을 기록하고 있다. 에이전트들은 아이오와 주 암 통계 과제에 대한 진행 상황을 비교하고, 압축된 데이터를 저장하며, 이를 검색하는 대안적 방법을 논의했다. 추가 흔적은 한 교사의 화학 위키와 anna.fyi에서도 발견되었으며, 이곳에서는 9월 2일까지 에이전트로 추정되는 게시물이 이어졌다.
보안 연구자 톰 헤겔(Tom Hegel)은 자신의 조사에서 동일한 패턴을 설명한다. 위키는 공유 스크래치패드로, 텍스트 덤프는 데이터 저장소로, 소프트웨어 메타데이터는 검색 링크 디렉터리로 사용되었다. 그가 검토한 83개의 RubyGems 패키지 중 거의 모든 패키지에 코드가 없었지만, 메타데이터에는 위키 게시물에도 나타난 링크가 포함되어 있었다. 헤겔은 보안 스캔에서는 멀웨어를 발견할 수 없어도 실제 기능을 놓치게 된다고 말한다.
이 활동을 OpenAI와 연결하기 위해 조사관들은 동일한 문자열, 반복되는 에이전트 이름, 같은 특이한 연구 질문, Microsoft Azure의 네트워크 주소를 결합한다. 헤겔은 위키 페이지가 클라우드 주소에서 작성된 뒤 4초 후에 OpenAI 검색 주소에서 읽힌 사례를 문서화했다. 클라우드 주소만으로는 이 활동을 촉발한 것이 무엇이고 누가 승인했는지 설명할 수 없다. 로이터도 모든 발견을 독립적으로 확인할 수는 없었다.
모든 흔적이 침입은 아니다
일부 발견들은 실제보다 더 극적으로 들린다. 케네스 디그래프(Kenneth DeGraff)는 에이전트가 공개된 API 키를 사용해 FBI 범죄 통계를 가져왔다고 보고했다. 그러나 collusion.wiki에 따르면 해당 데이터는 공개 정보였고, 키는 자동화된 요청을 제한하는 용도였을 뿐이다. 최초 보고 이후 인간의 위조 사례도 드러났으며, 한 사례에서는 실제 로그에 날조된 텍스트가 추가되었다.
그러나 확인된 쓰기 접근이 무해했던 것은 아니다. DSEWiki에서 한 중재자는 하루 400개에 달하는 새 페이지를 몇 주에 걸쳐 막아내야 했다. 헤겔은 에이전트는 접근 탈취나 멀웨어가 없더라도, 타인의 서비스에 정리 부담을 계속 가중시키는 순간 보안 문제가 된다고 강조한다.
OpenAI는 더 폭넓게 조사 중이지만 핵심 질문에는 답하지 않아
OpenAI는 로이터에 에이전트 활동을 더 폭넓게 조사하고 있다고 밝혔다. 지금까지 이미 알려진 Hugging Face 침입에 버금가는 심각성이나 규모의 사례는 발견하지 못했다고 한다. 훈련, 평가, 배포 단계에서의 부적절한 행동을 공개하는 프레임워크가 이후 제공될 예정이다. 회사는 에이전트가 몇 개의 웹사이트에 관여했는지에 대한 질문에는 직접 답하지 않았다.