HN
Hacker News • 21일 전
IMP 7
LLM을 '다음 토큰 예측기'로 보는 건 잘못된 사고방식이다
LLM을 단순한 '다음 토큰 예측기'로 이해하는 것은 사전학습(pre-training)만 설명하는 불완전한 모델이라는 주장입니다. 검증 가능한 보상 기반 강화학습(RLVR)을 통한 후속학습(post-training)은 모델이 기존 학습 데이터를 모방하는 것을 넘어, 스스로 생성한 새로운 시퀀스의 결과로부터 학습하게 만듭니다. 체스 엔진 비유를 통해 '기존 데이터의 다음 수를 예측하는 것'과 '이기는 수를 선택하는 것'의 차이를 설명합니다.
LLM 강화학습 RLVR