CLM-8B:开源系统一模型高速评估智能体候选动作
Contrastive-LM发布了开源系统一模型CLM-8B。该模型通过对候选动作进行打分而非生成文本来进行决策,运行速度最高可达Jev的九倍。

研究机构Contrastive-LM正式发布了CLM-8B,标志着对比语言模型(Contrastive Language Models,简称CLM)这一类别迎来了开源架构。与逐个标记(token)生成文本的传统自回归大语言模型不同,CLM-8B本身并不输出文本。相反,它根据环境的当前状态评估一组明确声明的候选动作,并输出这些选项的概率分布。这种架构转变专门针对自主智能体循环中的决策与路由环节,在这些环节中,传统的生成开销往往会带来显著的延迟。
CLM-8B的主要对比基准是Jev,后者是由TypeSafe AI开发的一款专有系统一(System One)模型,于2026年9月15日进入有限的早期访问阶段。与Jev类似,CLM-8B旨在提供结构化的分类选择,而非生成散文式的长篇文本。为了确保无缝集成,CLM开源代码库通过兼容TypeSafe的接口提供服务。该设计支持三种特定的查询格式:计算陈述为真概率的Noul格式;从包含指定概率的明确列表中选择单一候选动作的Choice格式;以及根据有序评分标准对输入进行评级的Score格式。
双编码器架构与智能体循环中的向量缓存机制
在底层架构方面,CLM-8B采用了由状态编码器和动作编码器组成的双编码器设计。两个编码器共享一个冻结的Qwen3-8B主干网络,并配合一个可训练的2000万参数投影头。训练过程优化了双向InfoNCE损失目标,该目标拉近给定状态的嵌入向量与实际执行动作的嵌入向量之间的距离,同时推远未选中的候选动作。在推理过程中,系统通过候选动作嵌入向量与状态嵌入向量的点积对选项进行排序,随后使用Softmax函数计算出最终的概率分布。
状态与动作表示的这种解耦分离为计算优化提供了巨大空间。在实际的智能体工作流程中,可用的动作集合往往保持静态,而环境状态在每一步都会改变。通过其专用的服务组件clm-serve,该系统从标准键值(KV)缓存机制中汲取架构灵感,在GPU显存中开辟专用空间来缓存预先计算的动作向量。在单张NVIDIA RTX 4090 GPU上针对三个候选动作进行的测试中,重用缓存向量使重复访问状态的延迟从1.7毫秒降低至0.6毫秒。在包含约1000个候选动作的大型选项集上,模型报告(model card)记录的推理速度比Jev快出多达13倍。
CLM-8B的训练流水线依赖于三阶段的序列方案,旨在提升排序准确率的同时不破坏冻结的基础编码器的稳定性:
- 在约6000万个Nemotron DQA问答对上进行预训练,在包含10万个问题的保留测试集上实现了52.1%的Top-1准确率。
- 在利用Gemini 2.5 Flash-Lite生成的约3000万个合成困难负样本上进行中期训练(mid-training),将Top-1准确率提升至69.2%。
- 在源自Agent Data Protocol、Endless-Terminals和LiteCoder-Terminal-SFT数据集的约100万条智能体轨迹上进行后期训练(post-training)。
Contrastive-LM的研究人员指出,如果在初始预训练阶段直接尝试使用困难负样本进行训练,会导致模型性能过早达到62.4%准确率的峰值并陷入严重的过拟合,这充分证明了实施分阶段课程学习策略的必要性。
零样本评估与验证器基准测试表现
在零样本对比评估中,CLM-8B相较于Jev展现出了显著的吞吐量优势。其延迟降低九倍的最高纪录是在T-Rex恐龙游戏测试中录得的,该环境中候选动作在连续的环境状态之间反复出现。在更广泛的评估中,CLM-8B在T-Rex和超级马里奥(Super Mario)环境中的表现与Jev持平,但在工具调用评估和WikiRacing任务上落后于Jev;不过,在所有被评估的场景中,CLM-8B均保持了更低的执行延迟。
除了反应式游戏控制外,CLM-8B还作为软件工程智能体的验证器(verifier)模型接受了评估。在此类工作流程中,生成式语言模型会采样多个候选解决方案,验证器随后对这些选项进行排序以选择最佳补全方案。在来自DeepSWE的38个保留任务中(使用Opus 5生成的4选1候选集),配备轻量级微调头的CLM-8B取得了81.6%的成功率。在来自Terminal-Bench 2.1的30个保留任务中(使用Fable 5生成的5选1候选集),该模型达到了87.6%的准确率。
在NVIDIA H100系统上进行的基准测量表明,CLM-8B在验证过程中的运行速度是Jev的4.1到5.7倍。研究团队特别强调,Jev在两个验证测试集上的得分均低于pass@1基准线,这意味着使用Jev进行选择的效果甚至比随机单次采样的结果更差。不过,作者明确指出,这些验证器数据反映的是在保留子集上经过专门微调的头部性能,并不代表零样本检查点(checkpoint)的表现或完整的排行榜提交结果。
技术局限与企业级部署前景
尽管运行效率极高,CLM-8B仍存在特定的功能限制。其投影头与Qwen3-8B的末尾标记池化(last-token-pooled)嵌入向量深度绑定,无法直接应用于其他基础模型架构。此外,该模型无法生成全新响应,仅能对外部输入的候选集合计算相对概率。Contrastive-LM表示,他们将在计划于10月初发布的更大规模多模态CLM-35B模型中探索更广泛的泛化能力。
对于正在构建自主智能体、代码助手或结构化路由管道的企业开发团队而言,CLM-8B为替代缓慢且昂贵的生成式大模型API调用提供了实用方案。整个系统采用Apache-2.0协议开源,投影头体积仅为75兆字节,可在单张NVIDIA GPU上与vLLM并存运行。企业可以在内部私有化部署高吞吐量的动作排序和工具路由服务,在彻底摆脱外部API依赖的同时,大幅压缩复杂多步工作流中的运行延迟。
信息来源
- Contrastive-LM Releases CLM-8BMarkTechPost · 2026年9月24日
- CLM-v0.1-8B model cardContrastive-LM · 2026年9月23日



