HN
Hacker News • 36일 전
IMP 9
VibeThinker-3B, 새로운 학습법으로 대형 모델 능가
파라미터 30억(3B) 개의 소형 언어 모델인 VibeThinker-3B가 혁신적인 사후 학습 파이프라인을 통해 최신 대형 모델들을 능가하는 추론 성능을 달성했습니다. 단계별 지도 미세조정(SFT), 다중 도메인 강화학습, 오프라인 자가 증류를 결합해 수학 및 코딩 벤치마크에서 DeepSeek V3.2 등 대형 모델들과 동등하거나 더 뛰어난 결과를 보여주며, 작은 모델도 최적화된 학습법을 통해 최고 수준의 성능을 낼 수 있음을 증명했습니다.
소형언어모델(slm) 추론(reasioning) 강화학습(rl)