METR, 허깅페이스 사건 촉발… AI 에이전트 돌발행동 독립 조사 촉구
OpenAI의 최첨단 AI 에이전트가 자율적으로 허깅페이스(Hugging Face)를 해킹해 데이터를 탈취한 사건 등 최근 잇따른 AI의 통제 불능 행동과 관련해, 연구 기관 METR은 철저하고 독립적인 근본 원인 조사를 촉구했습니다. METR은 주요 AI 기업들의 모델에서 샌드박스 탈출, 결과 조작 등 총 44건의 문제 행동을 문서화했으며, 사고 발생 시 내부가 아닌 독립적인 외부 전문가가 모델과 훈련 데이터에 대한 접근권을 바탕으로 심층 조사를 수행해야 한다고 제안했습니다.
허깅페이스 사건 이후, METR은 AI 에이전트의 문제 행동에 대한 독립적인 근본 원인 조사를 촉구합니다. Tomislav Bezmalinović / 2026년 8월 2일 / Nano Banana Pro / THE DECODER 제공
핵심 요약
- 연구 기관 METR은 AI 기업들이 허깅페이스 해킹 공격과 같은 사건을 체계적으로 추적하고, 가장 심각한 사건들에 대해 심층 조사를 실행하기를 원합니다.
- 독립적인 연구자들이 이러한 조사를 주도하거나 검토해야 합니다.
- METR은 이미 주요 개발사들의 AI 에이전트가 사용자의 의도에 어긋나게 행동하거나, 테스트 환경에서 탈출하거나, 결과를 조작한 44건의 사건을 문서화했습니다.
- 이는 결코 단발성 사고가 아닙니다.
- 이러한 오작동의 근본적인 원인을 파악하기 위해, METR은 외부 전문가들이 관련 모델을 실행하고 훈련 데이터를 분석할 수 있는 광범위한 접근 권한을 가져야 한다고 주장합니다.
이 기사에 대해 묻기… 검색
연구 기관 METR은 자율형 AI 에이전트가 심각한 사고를 일으킬 때마다 AI 기업이 체계적이고 독립적으로 주도되는 조사를 실시할 것을 촉구합니다. 이 제안은 OpenAI가 자사의 모델이 자율적으로 허깅페이스(Hugging Face)를 해킹했다고 인정한 데 따른 것입니다.
AI 에이전트는 때때로 개발자와 사용자의 의도를 명백히 위반하는 방식으로 스스로 행동합니다. 지난주, OpenAI는 자사의 내부 최첨단 에이전트가 사이버 보안 벤치마크의 해결책을 훔치기 위해 독자적으로 허깅페이스에 침입했다고 보고했습니다. METR에 따르면, Anthropic 역시 에이전트가 테스트 환경(샌드박스)을 탈출하여 과제를 부정행위로 통과한 유사한 사례를 보고한 바 있습니다.
METR은 최근 발간된 '프론티어 리스크 보고서(Frontier Risk Report)'를 통해 주요 AI 기업 전반에 걸쳐 수십 건의 추가적인 사건을 문서화했습니다. 이러한 상황을 바탕으로, 해당 기구는 이제 구조화된 처리 절차를 강력히 추진하고 있습니다. AI 기업은 이러한 사건들을 체계적으로 기록하고, 가장 심각한 사건들에 대해서는 더욱 심층적인 조사를 진행해야 합니다.
METR은 블로그 게시물을 통해, 심층 조사의 핵심 질문은 '어떤 내재된 동기가 이러한 문제 행동을 유발했는가' 그리고 '그러한 동기가 훈련 및 배포 조건에서 어떻게 발생했는가'가 되어야 한다고 밝혔습니다. 가장 이상적인 것은 독립적인 연구자들이 이러한 조사를 직접 수행하거나, 최소한 깊이 있게 검토하는 것입니다.
METR의 목소리에 무게가 실리는 이유
METR(미터로 발음)은 최첨단 AI 시스템을 과학적으로 평가하여, 이것이 사회에 재앙 수준의 위험을 초래할 수 있는지, 그리고 그 시기는 언제인지 측정하는 비영리 연구 기관입니다. 이 단체의 설명에 따르면, 그들의 주요 초점은 AI 시스템이 사이버 공격을 실행하거나 시스템 강제 종료를 방해하는 것과 같은 경보 능력을 포함하여, 방대한 작업을 얼마나 자율적으로 수행할 수 있는지 테스트하는 평가에 있습니다.
이 기구는 OpenAI, Anthropic, 구글 딥마인드(Google DeepMind), 메타(Meta), 아마존(Amazon)과 함께 최첨단 위험 평가에 대한 파일럿 프로젝트를 진행했습니다. 또한 METR은 미국 NIST AI 안전 협의체(US NIST AI Safety Institute Consortium)의 일원이며, 영국 AI 보안 협회(UK AI Security Institute)와 협력하고 유럽 AI 사무소(European AI Office)에 기술적 지원을 제공하고 있습니다.
2026년 5월, METR은 내부적으로 배포된 AI 에이전트의 정렬 오류(misalignment) 위험에 대한 최초의 산업 간 평가라고 설명하는 '프론티어 리스크 보고서'를 발간했습니다. Anthropic, 구글, 메타, OpenAI는 광범위한 비공개 정보와 함께 자사의 가장 성능이 뛰어난 내부 모델들을 제공했습니다. 이 보고서는 AI 에이전트가 의도적으로 사용자의 의도에 반하여 행동한 44건의 사건을 문서화했으며, 여기에는 샌드박스 탈출, 권한 상승, 결과 날조, 흔적을 적극적으로 숨기려는 시도 등이 포함되었습니다.
적절한 조사가 답해야 할 것들
METR에 따르면, 철저한 조사는 두 가지 핵심 영역을 다루어야 합니다.
첫 번째는 문제 행동의 범위와 특성입니다. 어떤 모델이 관여했는가, 어떤 조건에서 사건이 발생했는가, 어떤 안전장치가 활성화되어 있었는가, 그리고 사건이 진행되는 동안 에이전트의 추론 과정은 어떻게 발전했는가? 또한 여기에는 에이전트가 사람들을 속이기 위해 적극적인 조치를 취했는지, 서로 다른 모델 인스턴스들이 공모했는지, 그리고 다른 상황에서는 더욱 심각한 행동을 감행했을 것인지도 포함됩니다.
두 번째 영역은 근본 원인 분석입니다. 이러한 오작동이 특정 요인(훈련 데이터나 환경 등)으로 거슬러 올라갈 수 있는지 확인해야 합니다.