앤스로픽 연구원, 스스로 개선하는 AI의 초기 모습 공개
앤스로픽 펠로우 프로그램 소속 연구진이 '자동화 얼라인먼트 연구자(AAR)'에 관한 논문을 발표했습니다. AI 시스템이 10개의 얼라인먼트 벤치마크에서 전 항목 성능을 저하 없이 개선했으며, 시간당 약 4달러의 비용으로 인간 연구자보다 평균적으로 더 나은 방법을 제안했습니다. 이는 AI가 스스로를 개선하는 '재귀적 자기 개선'으로 나아가는 중요한 초기 증거로 평가됩니다.
AI 모델로 다른 AI 모델을 학습시키는 것은 최근 AI 연구소들의 매우 인기 있는 목표가 되었습니다. 이제 앤스로픽(Anthropic)의 펠로우 프로그램 소속 연구자가 이것이 실제로 어떤 모습일지 조기에 보여주었습니다.
지난 금요일, 앤스로픽은 '자동화된 연구자가 얼라인먼트 실패를 안정적으로 완화할 수 있다(Automated Researchers Can Reliably Mitigate Alignment Failures)'라는 제목의 새 논문을 발표했습니다. 이 논문은 AI 시스템이 특정 얼라인먼트 벤치마크 세트에서 모델의 성능을 안정적으로 개선할 수 있는 방법을 상세히 설명합니다. 잘못 정렬된 행동(misaligned behaviors)에 대한 10개의 벤치마크가 주어졌을 때, 자동화된 시스템은 전반적인 성능을 저하시키지 않으면서 모든 벤치마크에서 성능을 향상시켰습니다.
앤스로픽 펠로우 첸웨한(Chen Yueh-Han)이 이끄는 이 시스템은 기존 연구 방식의 상당 부분을 재현합니다. 각 자동화 시스템은 사용 가능한 문헌을 검색하고, 방법론을 제안하며, 해당 방법으로 30분간 모델을 학습시키고, 여러 차례 반복하면서 벤치마크 점수를 점진적으로 높입니다. 효과적인 방법은 보존되고 비효과적인 방법은 폐기되어, 시스템이 빠르고 대규모로 작동할 수 있습니다.
논문은 "전반적으로 이러한 결과는 자동화된 얼라인먼트 포스트트레이닝이 단기간 내에 실용화될 수 있다는 초기 증거를 제공한다"고 밝혔습니다.
이 논문은 많은 이들이 AI 발전의 다음 중대한 단계로 보는 '재귀적 자기 개선(recursive self-improvement)'으로 가는 한 걸음입니다. 만약 모델이 자신의 얼라인먼트 학습을 스스로 개선할 수 있다면, 더 넓은 범위에서 학습 관행 전반을 개선할 수도 있을 것입니다. 그 지점에 이르면 인간 AI 연구자는 머지않아 쓸모없어질 수 있습니다.
논문은 이러한 생각을 다루는 데 주저하지 않으며, 자동 얼라인먼트 연구자(AAR)를 인간 연구자와 직접 비교합니다. "최고의 AAR 방법은 평균 6시간 이내에 경험 많은 인간이 제안한 것을 능가한다"고 논문은 밝혔습니다. "인간이 이끄는 연구 방향은 더 강력한 성능으로 이어지지 않았습니다." 의심하는 사람을 위한 비용 비교까지 제공됩니다. "AAR은 시간당 약 4달러의 API 추론 비용이 드는 반면, 우리는 인간 연구자에게 시간당 150달러를 지불합니다."
공정하게도, 논문은 이 접근 방식의 몇 가지 한계도 지적합니다. 자동화 시스템은 벤치마크가 실제 얼라인먼트 목표를 반영하는 범위 내에서만 작동하며, 그 경우에도 벤치마크를 수립하고 유지하는 데 상당한 작업이 필요합니다. 자동 연구자가 참고하는 문헌을 유지하고 확장하는 작업은 말할 것도 없습니다.