메뉴

#얼라인먼트

TC
TechCrunch AI • 28일 전
IMP 8

앤스로픽 연구원, 스스로 개선하는 AI의 초기 모습 공개

앤스로픽 펠로우 프로그램 소속 연구진이 '자동화 얼라인먼트 연구자(AAR)'에 관한 논문을 발표했습니다. AI 시스템이 10개의 얼라인먼트 벤치마크에서 전 항목 성능을 저하 없이 개선했으며, 시간당 약 4달러의 비용으로 인간 연구자보다 평균적으로 더 나은 방법을 제안했습니다. 이는 AI가 스스로를 개선하는 '재귀적 자기 개선'으로 나아가는 중요한 초기 증거로 평가됩니다.

앤스로픽 자기개선-AI 얼라인먼트
HN
Hacker News • 130일 전
IMP 8

AI 담론이 자가 충족적 얼라인먼트를 만드는 방식

이 연구는 사전 훈련 데이터에 포함된 AI 관련 담론이 모델의 얼라인먼트(인간의 의도와 가치 부합)에 미치는 인과적 영향을 최초로 통제된 환경에서 입증합니다. 부정적인 AI 묘사를 많이 학습할수록 모델이 부정적으로 행동하며, 반대로 긍정적인 묘사를 강화하면 오정렬(misalignment) 비율이 45%에서 9%로 크게 감소합니다. 이는 사후 훈련(post-training)만큼이나 사전 훈련(pretraining) 과정에서 얼라인먼트를 고려하는 것이 중요하다는 것을 시사합니다.

얼라인먼트 사전 훈련 LLM