메뉴

#그로킹

TD
The Decoder 52일 전
IMP 8

대형 언어 모델이 소형 모델이 놓치는 능력을 습득하는 이유

Anthropic과 Stanford 등의 연구진에 따르면, 소형 모델은 학습 과정에서 흔하게 등장하는 작업에 편향되어 드문 작업을 학습하자마자 잊어버리는 현상을 겪습니다. 반면 대형 모델은 넉넉한 용량을 바탕으로 흔한 작업을 먼저 마스터한 뒤, 드문 작업의 패턴을 안정적으로 암기하고 법칙을 깨달아(grokking) 새로운 상황에 일반화할 수 있습니다. 이는 모델의 크기를 무작정 키우는 대신, 특정 기능을 원하는 수준으로 학습시키기 위해 훈련 데이터 내에서 해당 작업의 등장 빈도를 높이는 것이 더 효율적인 대안이 될 수 있음을 시사합니다.

대형 언어 모델 모델 학습 스케일링 법칙