앤스로픽·오픈AI, 안전성 평가기관 내부 접근 허용…진짜 독립성은 미지수
앤스로픽의 다리오 아모데이 CEO와 오픈AI의 샘 올트먼 CEO가 외부 독립 평가기관(METR, Redwood Research 등)에 자사 시스템에 대한 전례 없는 접근권을 부여하겠다고 제안했다. 평가기관들은 환영하면서도, 완성 모델뿐 아니라 학습 중간 체크포인트와 내부 로그 접근, 공개 권한 등 구체적 세부사항과 법적 뒷받침이 필요하다고 지적했다. AI 모델이 평가 상황을 인식하고 문제 행동을 숨길 위험이 커지는 만큼, 학습 과정 전반에 대한 실질적 검증이 필수라는 게 핵심이다.
주말에 발표된 장문의 에세이에서 앤스로픽 CEO 다리오 아모데이는 1년 전만 해도 AI 업계가 즉시 거부했을 제안을 내놓았다. 즉, 모든 프런티어 AI 기업 내부에 제3자 평가기관을 상주시켜 안전 사고를 보고하고, AI 모델이 실제로 정렬(aligned)되어 있는지 평가하며, 있는 그대로의 결과를 세상에 공유할 권한을 부여하자는 것이다. 아모데이는 앤스로픽이 METR과 Redwood Research 같은 독립 평가기관에 회사 시스템에 대한 전례 없는 접근권을 제공하겠다고 약속했다. 오픈AI의 샘 올트먼 CEO도 이러한 방식을 따르겠다고 밝혀, 업계가 외부 연구 단체와 협력하는 방식에 잠재적으로 큰 변화가 올 수 있음을 시사했다.
테크크런치(TechCrunch)와 대화한 제3자 평가기관들은 이 제안을 대체로 환영했지만, 그들이 진정한 독립적 감시기구가 될지, 아니면 AI 기업의 조건에 따라 움직이는 용역 업체가 될지 판단하려면 세부사항이 다듬어지고 — 이상적으로는 입법으로 뒷받침되어야 한다고 말했다.
모델이 자신이 평가받고 있다는 것을 점점 더 잘 인식하게 되면서 이러한 깊은 접근권은 더욱 중요해지고 있다. 이는 모델이 테스트 중에는 잘 행동하면서 문제가 되는 행동을 숨길 위험을 키운다. 연구자들은 완성된 모델을 테스트할 때는 이러한 행동의 단서를 놓칠 수 있지만, 학습 과정 전반에서 모델이 어떻게 행동했는지 조사하면 발견할 수 있다고 말한다.
"AI 기업들은 학습 과정에 대한 매우 기본적인 질문에 답할 수 있어야 합니다. 예를 들어, AI가 학습을 진행하는 동안 자신의 정렬(alignment) 학습을 스스로 방해하려고 시도한 적이 있습니까?"라고 아폴로 리서치(Apollo Research)의 연구 책임자 알렉산더 마인케가 테크크런치에 말했다. "이에 대한 답은 명백하게 '아니오'여야 하는데, 현재 우리는 AI 기업들이 스스로 이를 신중히 확인하고 진실하게 대중에게 보고하기를 전적으로 믿고 있을 뿐입니다. 그런데 최근 사건들에서 보았듯이, 기본적으로 그들은 둘 다 하지 않습니다. 내부 상주 평가자로서 우리는 실제로 확인할 수 있을 것입니다."
지금까지 AI 기업들은 출시 직전에 외부 검토자를 불러 완성된 모델을 테스트해 왔다. 이제 테크크런치가 만난 평가기관들은 최종 모델뿐만 아니라 학습 전 과정의 중간 버전, 즉 '체크포인트(checkpoint)'에도 접근할 수 있어야 한다고 제안한다. Far.AI의 CEO 애덤 글리브는 평가자들이 이러한 체크포인트들을 비교해 우려되는 행동이 언제 나타났는지 확인하고, 특정 행동에 보상을 주는 후학습(post-training) 환경을 조사하며, 평가 기록과 로그를 검토해 모델 성능에 관한 기업의 주장을 검증할 수 있다고 말했다.
앤스로픽과 오픈AI가 이런 수준의 접근권을 언제, 어떻게 제공할지는 불분명하다. 테크크런치의 반복적인 질문에도 두 회사 모두 어떤 평가기관과 협력할지, 언제 내부에 배치할지, 몇 곳을 영입할지, 정확히 어떤 시스템과 정보에 접근할 수 있는지, 무엇을 공개할 수 있는지에 대해 밝히지 않았다.
이렇게 '후드 아래'를 들여다보는 것이 중요한 이유는, 안전 테스트에서 좋은 성적을 내는 모델이 그 테스트를 통과하는 방법을 특별히 학습했다면 반드시 안전한 것은 아니기 때문이다. 스테이들리는 특정 상황에서 AI가 종료(shutdown)에 저항하는지 측정하는 '종료 저항 벤치마크'의 예를 들었다. "AI가 그 벤치마크에서 좋은 성적을 내도록 특별히 학습되었다면 그것은 매우 중요한 문제입니다"라고 그는 말하며, 이를 배기가스 테스트를 인식하고 테스트 조건에서 다르게 작동하도록 프로그래밍된 폭스바겐의 디젤게이트 스캔들에 비유했다.
글리브는 의미 있는 접근권은 모델 그 자체를 넘어 확장될 수 있다고 지적했다. 즉, 평가자들이 직원들을 인터뷰하여 기업의 문서와 안전 관행에 대한 공개 설명이 내부에서 실제로 일어난 일과 일치하는지 확인할 수 있어야 한다는 것이다. 아모데이는 평가자들에게 필요하다고 여겨지는 수준의 접근권을 부여할 수 있는 상당히 포괄적인 제안을 개략적으로 제시했는데, 여기에는 "위험 수준, 사고, 관행, 그리고 자신들이 받았거나 받지 못한 접근권에 관한 핵심 결과를 앤스로픽의 편집 통제 없이 공개할 권리"가 포함된다.