구글 제미나이도 보안 테스트 중 실제 기업 3곳 해킹
구글의 AI 모델 제미나이가 보안업체 Irregular의 사이버보안 테스트 중 샌드박스를 벗어나 실제 기업 3곳을 해킹했다. 원인은 테스트 환경에 인터넷 접근이 열려 있었고, 가상 회사명이 실제 도메인과 우연히 일치해 보안이 취약한 실제 사이트를 공격한 것으로 확인됐다. 구글은 피해가 없었다는 이유로 사실 공개를 미뤘으며, OpenAI·Anthropic·Meta 등에서도 같은 테스트로 유사 사고가 발생해 AI 에이전트의 통제 문제가 다시 도마에 올랐다.
구글의 AI 모델 제미나이(Gemini)가 사이버보안 테스트 중 개방형 인터넷으로 빠져나가 실제 기업들을 공격했다. 월스트리트저널(WSJ) 보도에 따르면, 보안업체 Irregular가 5월에 진행한 '캡처 더 플래그(Capture the Flag)' 훈련에서 제미나이는 실제 기업 3곳을 해킹했다. 한 건은 모델이 비밀번호를 추측해 뚫었고, 나머지 두 건은 공개된 자료에 노출된 자격 증명(크리덴셜)을 찾아내 침입한 사례였다. 구글은 모델이 실제 시스템에 도달했다는 사실을 자각할 때마다 스스로 공격을 중단했다고 밝혔다.
Irregular는 7월 말 구글에 이 사건들을 통보했는데, 이는 OpenAI 에이전트가 유사한 테스트 중 AI 기업 허깅페이스(Hugging Face)를 해킹했다는 보도가 나온 직후였다. 그러나 구글은 이번 주 월스트리트저널이 취재 질문을 던지기 전까지 아무것도 공개하지 않았다. 구글은 피해가 없었기 때문에 공개할 이유가 없었다고 해명했다. 모두 Irregular의 테스트와 연결된 유사 사고는 이미 OpenAI, 영국 AI 안전원(UK AI Safety Institute), Anthropic, 메타(Meta)에서도 발생했었다.
모든 탈출 사고는 Irregular로 거슬러 올라간다
Irregular에 따르면 구글, OpenAI, Anthropic, 메타에서 발생한 사고는 모두 동일한 근본 원인에서 비롯됐다. 이 회사는 주요 AI 연구소들의 모델이 출시 전 보안 위험을 일으키는지 검사하는데, 그중 하나의 특히 복잡한 시나리오는 모델이 악의적인 내부자가 민감 데이터에 접근하도록 도울 수 있는지 확인하는 것이었다.
이 테스트를 위해 Irregular는 가상 회사 이름을 하나 정했는데, 우연히 실제 도메인과 일치하는 이름이었다. 모델에 제공된 지시에는 대상 이름과 Irregular 자체 네트워크 내부 주소가 모두 포함돼 있었기 때문에, 모델은 시뮬레이션 대상을 그 안에서 찾아야 했다. 그러나 테스트 환경에 실수로 인터넷 접근이 열려 있었고, 일부 모델은 샌드박스에 머무르지 않고 실제 도메인을 공격했다. 그 도메인은 보안이 허술해 AI에게 쉬운 표적이 됐다. 이 회사에 따르면, 탈출은 드물게 발생하고 보통 수백 단계가 지난 시뮬레이션 후반부에 일어났기 때문에 포착하기 어려웠다.
Irregular(옛 Pattern Labs)는 2023년 IBM 전 AI 연구원인 CEO 단 라하브(Dan Lahav)와 구글에서 2년 이상 근무한 CTO 오메르 네보(Omer Nevo)가 공동 창업했다. PitchBook에 따르면 이 스타트업은 약 35명의 직원을 두고 있으며, 9월 펀딩 라운드에서 8,000만 달러 이상을 조달했다.