빠르고 일반화 가능한 의사결정을 위한 System One 모델
Stanford와 Nvidia의 CLM-8B은 대조 상태-행동 매칭으로 제한된 의사결정을 수행한다.
TL;DR
- CLM 저장소는 과제 상태와 후보 행동을 대조 학습으로 연결하는 의사결정 모델을 설명한다.
- 프로젝트는 선정된 테스트에서 Jev 대비 최대 9배 낮은 지연을 보고했으며, VentureBeat는 일부 과제에서 정확도 절충을 지적한다.
- 이 설계는 재사용 가능한 행동 표현을 캐시하지만, 보고된 벤치마크는 독립적으로 재현되지 않았다.
공식 저장소는 CLM을 System One 모델 계열로 제시하며, 텍스트 응답을 생성하는 대신 상태 인코더와 행동 인코더가 후보 선택을 점수화한다고 설명한다. Qwen3-8B 백본을 동결하고 학습 가능한 프로젝션 헤드를 사용한다고 기술한다. [1]
VentureBeat는 CLM-8B이 연구진의 제로샷 테스트에서 Jev보다 최대 9배 빠르게 동작했다고 보도한다. 같은 보도는 도구 호출과 WikiRacing을 포함한 일부 과제에서 더 낮은 점수를 기록해, 표면적인 속도 향상이 일률적인 성능 우위를 의미하지는 않는다고 전한다. [2]
저장소는 후보 집합이 고정된 경우 행동 임베딩을 여러 요청에 재사용할 수 있다고 설명한다. 벤치마크 수치와 실제 배포 환경에서의 적합성은 독립적인 검증이 남아 있다. [1] [2]
Why it matters
보고된 테스트 밖에서도 이 접근이 유효하다면, 에이전트 개발자에게 도구 선택과 순위 결정을 위한 별도의 저지연 의사결정 계층을 제공할 수 있다.
Editor's note
성능 수치는 연구진 평가에 귀속되며, 수집된 보도에서는 독립적인 재현을 확인하지 못했다.