컨트라스티브-LM, CLM-8B 공개…제브 대비 최대 9배 빠른 에이전트 행동 평가
Contrastive-LM이 텍스트를 생성하는 대신 후보 행동을 상태(state) 대비 점수로 매기는 오픈소스 System One 모델 CLM-8B를 공개했습니다. 고정된 Qwen3-8B 인코더에 작은 프로젝션 헤드 2개를 추가해 InfoNCE 대비 학습으로 훈련했으며, 제로샷 테스트에서 TypeSafe의 Jev보다 최대 9배 빠릅니다. 미세조정된 헤드를 검증기(verifier)로 사용할 경우 DeepSWE 유출 테스트에서 81.6%, Terminal-Bench 2.1 유출 테스트에서 87.6%의 성능을 달성했습니다.
Contrastive-LM이 CLM-8B를 공개했습니다. 이는 텍스트를 생성하는 대신 주어진 상태(state)에 대해 후보 행동들을 점수로 평가하는 오픈소스 System One 모델입니다. 고정된(frozen) Qwen3-8B 인코더에 작은 프로젝션 헤드(projection head) 2개를 추가하고, 이를 대조 학습 목표함수인 InfoNCE로 훈련했습니다. 제로샷 테스트에서 TypeSafe의 Jev보다 최대 9배 빠르게 동작합니다. 미세조정된 헤드를 검증기(verifier)로 사용할 경우, 평가용으로 분리된(held-out) DeepSWE 태스크에서 81.6%, Terminal-Bench 2.1 태스크에서 87.6%의 성능을 달성했습니다.
'Contrastive-LM Releases CLM-8B: An Open System One Model That Scores Agent Actions Up to 9× Faster Than Jev'라는 제목의 이 글은 MarkTechPost에 처음 게재되었습니다.