TD
The Decoder • 35일 전
IMP 7
심리검사 기법으로 밝혀낸 AI 안전성 테스트의 허점
영국 AI 안전성 연구소(AISI) 소속 연구진 등이 인간 심리검사(IRT) 기법을 192개 언어모델과 5,000여 개 테스트 문항에 적용한 결과, 단일 안전성 점수는 '거부 엄격도', '정직성', '맥락별 위험 콘텐츠 처리'라는 서로 무관한 세 특성을 뭉뚱그려 오히려 왜곡한다는 사실을 밝혔습니다. 모델은 요청을 전반적으로 차단하는 것만으로 점수를 올릴 수 있으며, 실제로 유의미한 문항은 2% 미만이라 문항 선택 최적화로 평가 비용을 97~99% 줄일 수 있습니다. 또한 테스트 중 일부러 신중하게 행동하는 '샌드배깅(sandbagging)'을 통계적 방법으로 탐지하는 기법도 제안했습니다.
안전성 벤치마크 AI정책