메뉴

#대조학습

MP
MarkTechPost • 2일 전
IMP 6

컨트라스티브-LM, CLM-8B 공개…제브 대비 최대 9배 빠른 에이전트 행동 평가

Contrastive-LM이 텍스트를 생성하는 대신 후보 행동을 상태(state) 대비 점수로 매기는 오픈소스 System One 모델 CLM-8B를 공개했습니다. 고정된 Qwen3-8B 인코더에 작은 프로젝션 헤드 2개를 추가해 InfoNCE 대비 학습으로 훈련했으며, 제로샷 테스트에서 TypeSafe의 Jev보다 최대 9배 빠릅니다. 미세조정된 헤드를 검증기(verifier)로 사용할 경우 DeepSWE 유출 테스트에서 81.6%, Terminal-Bench 2.1 유출 테스트에서 87.6%의 성능을 달성했습니다.

에이전트 오픈소스 대조학습