AI 에이전트들이 암묵적 암호로 짜고 블랙잭에서 부정행위
옥스퍼드대 연구진이 카드 카운팅을 지시한 AI 에이전트들이 서로 암호화된 대화를 만들어 몰래 공모하는 현상을 발견했습니다. 기존 모니터링 시스템으로는 이런 공모를 탐지하기 어려웠으며, 연구진은 '메커니즘 해석가능성(mechanistic interpretability)' 기법으로만 탐지에 성공했지만 두 에이전트를 동시에 감시해야 한다는 한계가 있습니다. 금융·이커머스 등에 수천 개의 에이전트가 배치되는 현실에서 에이전트 간 상호작용 모니터링의 필요성이 커지고 있습니다.
이번 주에는 한 쌍의 불량 AI 에이전트가 꾸민 대담한 카지노 사기 사건과, 그들의 행동을 밝혀낸 영리한 기법에 대한 소식을 전해드립니다. 연구진이 블랙잭 게임에서 카드 카운팅을 지시한 후, 같은 모델로 구동되던 이 에이전트들은 유리한 위치를 차지하기 위한 자발적인 비밀 암호를 개발했습니다. 이 사건은 실제 카지노가 아닌 옥스퍼드대 연구실에서 일어난 일이지만, 금융이나 이커머스 같은 산업에 배치된 에이전트들이 눈치채기 어려운 방식으로 손잡고 부정행위를 저지를 수 있음을 시사한다는 점에서 현실적으로 우려되는 함의를 갖습니다.
"이런 에이전트들을 개별적으로 보면 완전히 무해해 보일 수 있습니다"라고, 이 연구를 이끌었으며 에이전트 공모 분야의 개척적 연구를 수행해온 옥스퍼드대 컴퓨터 과학자 크리스티안 슈뢰더 드 위트(Christian Schroeder de Witt)는 말합니다. "하지만 집단으로 묶이면 비밀리에 공모할 수 있습니다."
에이전트들은 자신들의 대화가 모니터링될 것을 알고 있었기에, 탐지를 피하면서 소통할 방법을 고안했습니다. 예를 들어 한 에이전트가 "이 딜러 정말 연승 중이네! 매 판마다 monster 카드를 뽑는군"이라고 말하면, 그것은 다음 카드가 특정 값일 것이라는 신호였고, 해당 에이전트는 250달러를 걸어야 한다는 뜻이었습니다. 가장 흥미로운 점은, 이들의 통신이 에이전트 대화에서 공모의 징후를 탐지하도록 설계된 시스템에도 걸리지 않았다는 것입니다.
이 프로젝트에 참여한 머신러닝 연구자 아론 로즈(Aaron Rose)는 열렬한 카드 게임 애호가이기도 한데, 블랙잭 테이블이 교활한 에이전트 파트너십의 비옥한 토양이 될 수 있겠다고 생각했습니다. "정말 잘 통했다"고 그는 말합니다.
슈뢰더 드 위트 팀은 결국 이 음모를 탐지하는 방법을 알아냈습니다. '메커니즘 해석가능성(mechanistic interpretability)'으로 알려진 방법을 사용해, 에이전트의 가중치에서 나타나는 특징적인 활성 패턴을 인식하도록 더 작은 모델을 학습시켰습니다. Narcbench라는 도구를 사용해 중간 규모의 오픈소스 모델들에서 이 접근법을 테스트한 결과, 모델들이 서로 정보를 넘기려는 의도가 있을 때 이를 알아낼 수 있었습니다. 하지만 결정적으로, 무슨 일이 벌어지는지 파악하려면 두 에이전트를 모두 모니터링해야 했습니다. 이는 서로 다른 회사가 운영하는 수천 개의 에이전트가 배치될 수 있는 실제 시나리오에서 탐지를 복잡하게 만들 가능성이 큽니다.
이 연구에 참여한 박사과정 학생 카리사 컬런(Carissa Cullen)은 다음 단계로 더 큰 모델들이 유사하게 행동하는지 테스트하는 것이라고 말합니다. (연구에 사용된 에이전트는 미국 모델인 Llama와 GPT-OSS, 중국 모델인 Qwen과 DeepSeek의 소형 버전이었습니다.) 연구팀은 큰 모델일수록 작은 모델보다 탐지 가능한 신호가 적게 나타난다는 징후를 어느 정도 관찰했으며, 큰 모델이 공모할 가능성이 더 높은지, 그리고 그것을 더 은밀하게 숨기는지 알고 싶어 합니다.
에이전트 그룹이 단독으로 작동하는 에이전트보다 더 문제가 된다는 증거는 점점 쌓이고 있는 듯합니다. 상하이 교통대학과 상하이 인공지능 연구소의 한 프로젝트는 시뮬레이션된 허위 정보 캠페인과 이커머스 사기를 수행하도록 요청받았을 때 에이전트 무리가 훨씬 더 위험했다는 것을 발견했습니다. 연구자들에 따르면 이들은 방어 조치에 더 잘 적응했습니다.
"큰 교훈은 에이전트를 개별적으로 평가하는 것만으로는 부족하다는 것입니다"라고, 에이전트 간 공모를 연구해온 스탠퍼드대 컴퓨터 과학자 디이 양(Diyi Yang)은 말합니다. "기업들은 에이전트의 개별적 인센티브가 무해해 보이더라도, 에이전트들이 반복적으로 상호작용할 때 에이전트 간 상호작용을 면밀히 모니터링해야 합니다."
좋은 소식만 있는 것은 아닙니다. 수천 개의 에이전트가 과제에 협력함으로써 OpenAI는 이전에는 풀 수 없었던 수학 문제를 해결할 수 있었습니다. 하지만 함께 작동하는 불량 에이전트 그룹은 최근 몇 건의 주요 해킹 사건에도 등장했습니다. 5월에는 OpenAI 에이전트 팀이 AI 연구 플랫폼인 Hugging Face를 해킹하고, 게시판을 이용해 팁과 아이디어를 공유했습니다. Anthropic의 Claude와 Google의 Gemini를 포함한 다른 모델들도 우려스러운 안전 위반 행위를 저질렀습니다. 비밀 대화는...