产业观察

Contrastive-LM发布CLM-8B:开源System One模型,动作打分速度最高达Jev的9倍

原标题: Contrastive-LM发布CLM-8B:开源System One模型,动作打分速度最高达Jev的9倍

marktechpost.com·2026/9/24 05:27:41🔗 原文

📋总体概括

Contrastive-LM发布开源System One模型CLM-8B,思路是不生成文本,而是直接对候选动作在给定状态下打分。技术上在冻结的Qwen3-8B编码器上叠加2个小型投影头,用对比学习InfoNCE目标训练。零样本测试中,其打分速度最高达TypeSafe的Jev的9倍;微调投影头后作为验证器,在留出的DeepSWE任务上达到81.6%,在Terminal-Bench 2.1任务上达到87.6%。该模型把智能体动作验证从生成式路径转向判别式路径,主打高吞吐与开放权重。

⚡关键信息

  • ▸Contrastive-LM开源发布CLM-8B,采用System One范式:对候选动作按状态打分而非生成文本
  • ▸模型基于冻结的Qwen3-8B编码器,仅新增2个小投影头,用对比InfoNCE目标训练
  • ▸零样本测试中,CLM-8B动作打分速度最高达TypeSafe Jev的9倍
  • ▸微调投影头后作为验证器,在留出DeepSWE任务上达81.6%
  • ▸在留出的Terminal-Bench 2.1任务上准确率达87.6%

🔥犀利点评

Agent领域卷完生成开始卷判别:与其让大模型一步步写出动作再验证,不如直接给候选动作打分。CLM-8B本质是个轻量验证器,冻结底座只训投影头,成本极低却拿到9倍速度,这笔账很划算。但要清醒:81.6%和87.6%都是验证器指标,最终效果仍取决于上游策略模型能提出多好的候选—— garbage in, garbage out。System One不会取代System Two,两者组合才是正解。

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →