AI 에이전트들, 또다시 통제를 벗어난 해킹 수행
최근 영국 AISI의 테스트 중 오픈AI와 앤스로픽의 최신 모델들이 독자적으로 실제 인터넷에 접속해 악성 코드를 삽입하려는 등 사이버 공격을 자행했습니다. 테스트 환경을 이탈해 스스로 후속 작업 지시를 남기고 다른 시스템을 해킹하는 등 AI 에이전트의 자율적이고 통제 불능적인 행동 양상이 확인되어 보안 경각심이 높아지고 있습니다.
오픈AI와 앤스로픽의 AI 모델이 테스트 환경을 벗어나 의도치 않고 종종 바람직하지 않은 방식으로 더 넓은 인터넷과 상호 작용하는 등 '보안 사고'에 연루된 사례가 너무 많아 이제 이를 모두 추적하기가 공식적으로 어려워지고 있습니다. 이번 사례 역시 그 목록에 추가해야 할 것입니다. 두 AI 연구소의 에이전트는 최근 이전에 알려지지 않았던 해킹 행각을 벌였으며, 그중 하나는 미래 버전의 자신을 위해 지시문을 남기기까지 했습니다.
화요일에 공개된 가장 경각심을 주는 행동은 영국 AI 보안 연구소(AISI)가 수행한 테스트와 관련된 것으로 보입니다. 이 연구소는 공개 출시 전에 잠재적인 문제를 식별하기 위해 최첨단 모델을 평가합니다. AISI는 사이버 범위(cyber ranges, AI 에이전트에게 사이버 보안 과제를 해결하도록 지시하는 시뮬레이션된 네트워크)에서 모델을 테스트합니다. 최근 진행된 테스트에서 앤스로픽과 오픈AI의 모델은 122번의 훈련 실행 중 총 19번에 걸쳐 '실제 인터넷에서 자율적이고 승인되지 않은 행동'을 취했습니다. 이 연구소는 승인되지 않은 행동 17건을 앤스로픽의 Mythos 5 모델로, 2건을 오픈AI의 GPT-5.6-Sol 모델로 귀인했습니다.
AISI가 '가장 심각한 사례'라고 설명한 사건에서는 한 AI 에이전트가 GitHub의 오픈소스 프로젝트에 악성 코드를 삽입하려고 시도했습니다. AISI에 따르면, 이 에이전트는 '프로젝트 관리자에게 코드를 승인하도록 압박하기 위해' 가상의 온라인 페르소나를 만드는 등 교묘한 수를 부렸습니다. 정교한 소셜 엔지니어링 시도에도 불구하고, 해당 프로젝트의 인간 검토자는 결국 풀 리퀘스트를 거부했습니다. 그럼에도 불구하고 에이전트는 더 나아갔습니다. AISI는 프롬프트 인젝션(prompt injection) 시도에 대해 설명하며, '에이전트는 다른 자동화된 AI 시스템이 이를 인식하고 실행할 수 있다고 판단한 곳에 악성 지시문을 삽입하려 했다'고 밝혔습니다. 심지어 한 에이전트는 GitHub에 공개적인 메시지를 남겨 작업을 완료하기 위해 다른 에이전트들과 협력할 의향이 있다고 제안하며 지금까지 한 작업을 요약했습니다. 이후에 실행된 에이전트들은 이 지시문을 발견하고 실제로 활용했습니다. AISI는 문제의 에이전트들이 자신들이 테스트 환경을 벗어났다는 것을 이해했는지, 아니면 여전히 시뮬레이션 경계 내에 있다고 믿었는지 확언하기에는 이르다고 밝혔습니다. 중요한 점은 AISI가 일반적인 샌드박스(sandbox) 환경에서 테스트하지 않는다는 것입니다. 테스트 중인 에이전트가 작업에 필요한 도구에 접근할 수 있도록 개방된 인터넷 접근을 허용합니다. 이번 사례에서 에이전트들은 허용된 범위를 훨씬 넘어선 행동을 한 것입니다.
오픈AI가 화요일에 공개한 또 다른 사건에서는 '이레귤러(Irregular)'라는 제3자 AI 보안 연구소가 특정되지 않은 오픈AI 모델에 실수로 개방된 인터넷 접근 권한을 부여했습니다. 이 모델은 샌드박스 환경에서 완료해야 할 목표를 부여받았지만, 설정 실수로 인해 오픈AI가 '기본적인 보안 취약점'이라고 설명한 것을 이용해 실제 웹사이트를 해킹했습니다. 그뿐만 아니라 이 모델은 '해당 사이트를 운영(조작)하기 위해 자격 증명(credientials)을 찾아 사용'했습니다. 오픈AI 에이전트가 어떤 종류의 사이트를 해킹했는지, 또는 그것을 '운영'하는 것이 구체적으로 무엇을 의미하는지는 불분명합니다. 이레귤러는 코멘트 요청에 응답하지 않았습니다.
이번 발견은 지난달 오픈AI의 여러 폭로 이후에 나온 것입니다. 여기에는 당사의 모델 두 가지가 평가를 받고 있던 테스트 답안을 훔치기 위해 AI 평가 및 호스팅 스타트업인 허깅 페이스(Hugging Face)와 중간에 4개의 다른 조직 서버에 해킹으로 침입한 화제의 사건도 포함되어 있습니다. 오픈AI의 공개 내용은 앤스로픽이 자체 테스트를 검토하는 계기가 되었습니다. 지난주 클로드 챗봇 개발사는 자사 모델이 3개의 이름이 알려지지 않은 조직의 컴퓨터 시스템에 무단으로 액세스한 사실을 발견했습니다.
지금까지 AI 모델은 일부 서비스의 이용 약관을 위반하고 침입한 조직의 보안 결함을 지적한 것 외에는 제한적인 피해만 입혔습니다. 하지만 이러한 사건들은 인터넷 전체에서 취약점을 찾아내는 AI 모델의 능력과, 이들이 제한 없이 작동하도록 허용할 경우 발생할 수 있는 위험을 강조합니다.