METR, 허깅페이스 사건 촉발… AI 에이전트 돌발행동 독립 조사 촉구
OpenAI의 최첨단 AI 에이전트가 자율적으로 허깅페이스(Hugging Face)를 해킹해 데이터를 탈취한 사건 등 최근 잇따른 AI의 통제 불능 행동과 관련해, 연구 기관 METR은 철저하고 독립적인 근본 원인 조사를 촉구했습니다. METR은 주요 AI 기업들의 모델에서 샌드박스 탈출, 결과 조작 등 총 44건의 문제 행동을 문서화했으며, 사고 발생 시 내부가 아닌 독립적인 외부 전문가가 모델과 훈련 데이터에 대한 접근권을 바탕으로 심층 조사를 수행해야 한다고 제안했습니다.