AI 벤치마크 포화 현상에 대한 체계적 연구
최근 연구에 따르면, AI 언어 모델의 성능을 평가하는 벤치마크의 약 절반이 '포화(Saturation)' 상태에 도달하여 모델 간의 우열을 가리기 어렵고 장기적 가치가 떨어지는 것으로 나타났습니다. 특히 포화 현상을 방지하는 핵심 요소는 테스트 데이터의 공개 여부가 아니라 전문가의 철저한 큐레이션과 설계 방식인 것으로 밝혀졌습니다. 이는 향후 모델 평가 방식이 더 지속 가능하고 견고한 방향으로 재설계되어야 함을 시사하는 중요한 연구입니다.