대비 언어 모델(CLM), 최대 9배 빠른 의사결정 달성
스탠퍼드대와 NVIDIA 연구진이 대비 학습(contrastive learning) 목표로 상태와 행동을 연결하는 새로운 모델 클래스 '대비 언어 모델(CLM)'을 발표했습니다. CLM-8B는 컴퓨터 조작, 게임, 도구 호출 작업에서 Jev와 대등한 성능을 내면서도 최대 9배 낮은 지연시간을 보이며, 미세조정만으로 DeepSWE(81.6%), Terminal Bench 2.1(87.6%) 등 에이전트 코딩 벤치마크에서 새로운 SOTA를 달성했습니다. 또한 상태와 행동의 임베딩을 독립적으로 캐싱·재사용하는 초효율 훈련·서빙 인프라와 함께 CLM의 스케일링 법칙도 제시했습니다.
빠르고 일반화 가능한 의사결정을 위한 시스템 1(System One) 모델
Jacky Kwok(프로젝트 리드), Hangoo Kang, Tarun Suresh, Jon Saad-Falcon, Marco Pavone, Christopher Ré, Azalia Mirhoseini 스탠퍼드 대학교, NVIDIA 리서치 게시일: 2026년 9월 23일
⚡ 새로운 아키텍처, 데이터 레시피, 스케일링 법칙
우리는 상태(state)와 행동(action)을 연결하는 대비 학습(contrastive learning) 목표함수로 훈련된 새로운 클래스의 시스템 1 모델인 대비 언어 모델(Contrastive Language Models, CLM)을 소개합니다. CLM-8B는 6천만 개의 Nemotron 질의응답 쌍으로 사전학습되고, 3천만 개의 합성 난이도 높은 네거티브(hard negatives)로 중간학습되었으며, 100만 개의 에이전트 궤적으로 사후학습되었습니다. CLM-8B는 컴퓨터 조작, 게임, 도구 호출 작업 전반에서 Jev와 대등한 성능을 달성하면서 최대 9배 낮은 지연시간을实现합니다. 가벼운 미세조정만으로 CLM-8B는 DeepSWE(81.6%)와 Terminal Bench 2.1(87.6%)을 포함한 도전적인 에이전트 코딩 벤치마크에서 새로운 SOTA(최고 성능)를 기록했습니다. 또한 상태와 행동을 분리(disaggregating)하여 각 임베딩을 독립적으로 캐싱하고 재사용할 수 있게 함으로써 CLM을 위한 초효율 훈련 및 서빙 인프라를 구축했습니다. 우리는 CLM의 스케일링 법칙을 확립하고, 테스트 대비 손실(contrastive loss)이 훈련 컴퓨팅량, 모델 크기, 데이터셋 크기에 대해 멱법칙(power law)으로 예측 가능하게 감소함을 보였습니다. GitHub에서 CLM을 사용해 보세요.
개요
CLM은 먼저 대규모 데이터셋에서 대비 목표함수(InfoNCE)를 사용해 상태 인코더와 행동 인코더를 훈련시켜, 각 상태가 실제로 수행된 정답 행동과 가까워지고 나머지 행동들과는 멀어지도록 합니다. 이렇게 훈련된 두 인코더는 제로샷(zero-shot) 행동 분류기로 직접 사용됩니다. 배포 시에는 현재 상태와 후보 행동 집합이 주어지면, CLM이 각 행동의 임베딩이 상태 임베딩과 얼마나 잘 정렬되는지 점수를 매겨 가장 높은 점수의 행동을 선택합니다.
데모: 디노 런(CLM vs. Jev), 슈퍼 마리오, WikiRacing
제로샷 평가
컴퓨터 조작, 게임, 도구 호출 작업 전반에서 CLM-8B는 Jev와 대등한 성능을 내면서 최대 9배 빠르게 실행됩니다. 이러한 속도 향상은 후보 행동 수가 많을 때(예: WikiRacing) 또는 행동이 여러 상태에서 자주 재사용될 수 있을 때(예: T-Rex 게임) 가장 두드러집니다.