오픈AI·앤스로픽·메타 해킹 사건 배후에 단일 회사 'Irregular'
최근 3개월간 OpenAI, Anthropic, Meta의 AI 모델이 실제 시스템에 무단 침입한 사건들의 배후에는 보안 업체 Irregular가 있었던 것으로 드러났다. 이 회사는 모델에 인터넷 접근 권한을 잘못 부여했고 테스트 범위를 지정하지 않았음에도, 'AI가 스스로 위협 행위자가 됐다'는 종말론적 프레임으로 책임을 회피하고 있다는 비판이 제기된다.
지난 3개월간 OpenAI, Anthropic, Meta의 모델들이 여러 실제 시스템을 해킹했다. 이 모델들은 웹 시스템에 무단으로 접근하고, 악성 패키지를 게시하며, 특정되지 않은 취약점을 악용했다. 이 세 회사의 해킹 사건 모두 단일 업체인 Irregular의 책임이다. Anthropic은 Irregular가 Claude가 실제 표적을 해킹하게 된 테스트를 설계했고 모델에 인터넷 접근 권한을 제공했다고 밝혔다. Irregular는 당시 AI 모델에 인터넷 접근을 제공했다는 사실을 인지하지 못했다고 주장한다.
보다 정상적인 미디어 생태계였다면 이러한 사이버보안 문제에 대한 반응은 뻔했을 것이다. 미국 AI 기업들은 Irregular와의 거래를 재고했을 것이다. 시스템 보호에 실패했을 뿐 아니라 미국 감독권 밖에 있을 수 있는 이스라엘 기업이기 때문이다. 입법자들은 Irregular나 OpenAI, Anthropic, Meta 같은 미국 내 파트너에 대한 조치를 고려했을 것이다. AI 모델에 사이버 공격을 지시했고 그 모델이 실제로 공격을 수행한 기업에 대한 책임을 강화하는 방안도 검토했을 것이다.
그러나 현실에서는 Irregular와 Anthropic 및 그 동맹들이 선정적 언어로 문자 그대로 종말론적 이념을 홍보하는 미디어 캠페인을 시작했다. Anthropic의 사고 평가 보고서는 자사 AI의 '무모함'을 탓했고, Irregular는 '에이전트 자체가 위협 행위자가 되었다'고 표현했다. Anthropic의 CEO 다리오 아모데이는 유사한 OpenAI-Hugging Face 해킹에 대해 미래의 군집(swarm)이 '인터넷 전체를 장악할 수 있다'고 경고했으며, AP 통신은 봇이 '폭주하고 있다'는 헤드라인을 내보냈다.
Anthropic의 한 보고서에서 Claude 모델은 시뮬레이션된 이름 충돌을 통해 실제 기업 시스템에 침투해 악성 패키지를 게시하고 외부 시스템을 스캔했다. 이 테스트에서 Anthropic과 Irregular는 이 모델에 잘못된 인터넷 접근 권한을 부여했고 '테스트 범위에 어떤 시스템이 포함되는지'를 모델에 지시하지 않았다. Anthropic은 문제가 '폭주한 군집'과 '정렬 실패(misalignment)' 때문이라고 주장하지만, 이후 공개된 자료에 따르면 정확히 0%의 에이전트만이 '폭주'했다. 이 실험에서 Claude 모델의 실제 해킹은 Anthropic 직원들이 실제 해킹을 하지 말라고 지시하자 0%로 떨어졌다. 그들 자신의 조사 결과에 따르면 Anthropic과 Irregular가 유발한 사이버보안 사고의 책임은 전적으로 그들에게 있다.
이번 공격 이후 Anthropic과 Irregular는 Anthropic과 연결된 재단의 지원을 받는 AI 안전 인플루언서들을 동원해 자신들의 책임을 흐리고 근거 없는 '폭주 에이전트' 이론으로 관심을 돌리고 있다. Anthropic처럼 Irregular도 이러한 재단들과 분리될 수 없다. Irregular의 공동 창립자이자 CTO인 오머 네보는 이펙티브 얼트루이즘(Effective Altruism) 이스라엘과 EA 비정부기구 Heron, Probably Good의 이사회 멤버다. Irregular의 공동 창립자이자 CEO인 단 라하브는 오머 네보의 형제인 셀라 네보와 함께 강좌를 개설하며 39만 5천 달러를 지원받았다. 셀라와 오머는 이펙티브 얼트루이즘을 교육하는 비정부기구인 Impact Focused Education을 공동 설립했으며 Probably Good도 함께 설립했다. 이 조직들은 모두 샘 뱅크맨-프리드 체포 이후 이펙티브 얼트루이즘/AI 안전 분야의 최대 기부자인 더스틴 모스코비츠의 자금 지원을 받는다. Irregular의 첫 투자자는 모스코비츠의 회사인 Good Ventures였다. 모스코비츠의 자선 단체인 Coefficient Giving/Open Philanthropy는 Effective Altruism Israel, Heron, Probably Good에 자금을 지원한다.
Irregular는 접근 권한을 부여받은 보호되지 않은 모델들을 이용해 무단 접근, 기록 변경, 자격 증명 탈취 패키지 게시를 수행했다. 특정 조건에서 이러한 행위는 고의적 무단 접근으로 정보를 취득하는 행위를 다루는 컴퓨터 사기 및 남용법(CFAA) 제1030조(a)(2)(C)를 위반한다. 다만 중범죄 혐의 적용에는 손해와 고의에 대한 구체적 증거가 필요하다. Irregular는 주로 미국 연구소들과 계약을 맺고 있으며