一个不思考的模型,赢了所有会思考的

2026.09.24 17:27
斯坦福与NVIDIA Research联合发布CLM-8B,采用对比学习将决策简化为向量匹配,在16.5毫秒内完成决策,比TypeSafe的Jev快9.1倍。微调为验证器后在DeepSWE上达到81.6%、Terminal-Bench 2.1上达到87.6%,均为新SOTA。这不仅是开源对商业的反超,更标志着AI Agent架构从'一个模型通吃'向System One+System Two混合模式演进的根本转向。

一个不需要“思考”的模型,在验证编码任务上打败了所有会思考的模型。这听起来像悖论,但2026年9月23日斯坦福大学与NVIDIA Research联合开源的CLM-8B,正在让这个悖论变成现实。

CLM(Contrastive Language Model)不走深度推理路线。不写链式思维,不生成中间步骤,不反复自我纠错。它只是把“状态”和“动作”映射到同一个向量空间,算余弦相似度,选分数最高的那个。但结果一点都不简单:在T-Rex游戏任务上,CLM-8B的推理延迟只有16.5毫秒,比TypeSafe的Jev快9.1倍;在WikiRacing上快2.8倍;在BFCL V4工具调用上快1.6倍,而成功率基本持平。当它被微调为验证器后,在DeepSWE编码基准上拿到81.6%,在Terminal-Bench 2.1上拿到87.6%,均为新的最优成绩。

这不是又一个大模型。这是一个全新的物种。

九天内,一个赛道从定义到被反超

2026年9月15日,TypeSafe AI结束了两年隐身,正式发布Jev。这是第一个被公开明确定义为“System One Model”的产品。Jev不做对话,不做长文本生成,它只做一件事:输入非结构化状态,输出带置信度的类型化决策值。创始人Diogo Almeida曾参与发明RLHF,是InstructGPT和ChatGPT的核心贡献者。公司一出手就拿到DCVC领投的4000万美元种子轮。LangChain不到两天就发布了集成工具包。在一个被ChatGPT定义的市场里,Jev打开了一条全新的道路。

但这条道路的独占权只维持了8天。

9月23日,斯坦福大学博士生Jacky Kwok领衔,联合NVIDIA Research的Marco Pavone、Azalia Mirhoseini,以及斯坦福教授Christopher Ré等七位研究者,发布了CLM及CLM-8B。模型权重以Apache 2.0协议开源在Hugging Face上,代码完整托管在GitHub。它不仅实现了Jev定义的System One接口范式,还从多个维度实现了超越,而且完全公开、可复现、可自部署。

从行业视角看,这可能是2026年AI领域最重要的信号之一:一个由Jev定义的赛道,8天之内就迎来了一个开源的反超者。

CLM的技术密码:决策不是推理

CLM的核心洞察极其锋利:大多数AI Agent的任务根本不需要推理,只需要匹配。

传统大模型的决策方式是读入状态,用CoT一步步推理,思考,然后生成文本答案。这在丹尼尔·卡尼曼的“思考快与慢”框架中是典型的System Two(慢思考)。但很多场景下,比如路由一个工具调用、判断一个代码块是否正确、在游戏中选择下一步动作,你需要的不是深思熟虑,而是瞬间识别出“哪个选项最合适”。

CLM的架构因此极为精简:一个state encoder和一个action encoder,各自基于冻结的Qwen3-8B骨干网络,加上一个仅2000万参数的可训练投影头。训练使用双向InfoNCE损失函数,拉近正确的“状态-动作”对,推远所有错误的。推理时,对每个候选动作,只需计算state embedding和action embedding的余弦相似度,选相似度最高的那个。

关键创新是“解耦”(disaggregation)。因为状态和动作的编码器完全独立,它们的embedding可以被各自缓存复用。当状态连续变化但候选动作集固定时,比如游戏中每一帧的操作菜单、Agent的工具路由表,你只需要重新编码变化的状态侧,动作embedding一次编码即可无限次复用。推理成本降低到“一次embedding加上一次点积”。候选集越大、复用率越高,CLM的加速就越显著。这就是为什么在T-Rex游戏中能达到9.1倍加速,而在动作集较小的BFCL V4工具调用中加速比回落到1.6倍,两者背后是同一个机制。

数据配方的秘密:两段式训练的7%优势

对比学习模型有一个众所周知的陷阱:如果只靠随机的负样本训练,模型很容易学会浅层特征。它看到“不同”就区分,而不是真正理解“为什么不对”。CLM团队的数据配方因此经过了精心的三段式设计。

第一阶段是预训练。在6000万Nemotron Q&A对上进行基础语义匹配学习。Nemotron是NVIDIA内部的高质量数据集,覆盖广泛的知识领域和问答模式,为模型提供了扎实的语义理解底座。

第二阶段是中训练。使用3000万合成硬负样本(synthetic hard negatives)进行精炼。硬负样本是与正确答案非常相似但错误的选项,模型必须捕捉真正的区别性特征才能将它们分开。这一阶段是CLM准确率的关键贡献者。

第三阶段是后训练。在100万Agent轨迹数据上微调,让模型适应实际的Agent决策场景。

团队的训练研究发现了一个重要结论:先预训练再做硬负样本的两段式数据策略,在固定预算下比全程使用硬负样本的准确率高7%。硬负样本是一个强大的精炼信号,但不能替代预训练。在CLM的语境下,预训练负责学“什么是对的”,硬负样本负责学“对和几乎对有什么区别”。两者缺一不可。

这一发现的启示超出CLM本身:它为所有基于对比学习的AI系统提供了一个可复用的数据训练方法论。

验证器效应:CLM的真正杀手锏

在零样本决策任务上,CLM-8B与Jev可以说是各有千秋。

BFCL V4工具调用:Jev 99.2%的准确率略高于CLM的95.2%,但CLM的延迟76.8ms远快于Jev的125.5ms。WikiRacing:Jev 30/30全中,CLM 26/30略低,但延迟79.8ms对225ms。T-Rex游戏和Super Mario的准确率则基本相当,CLM的延迟优势分别为9.1倍和2.4倍。在零样本场景下,CLM以显著更快的速度达到了与Jev近似或稍低的准确率。

但在验证器(verifier)场景中,局面被完全翻转。

当CLM被微调后用于对Agent生成的候选代码进行评分和筛选时,结果令人震惊:

  • DeepSWE基准:CLM达到81.6%,远超Jev的71.1%和Pass@1随机基线73.7%。CLM推理延迟仅79毫秒,Jev需要449毫秒,差距5.7倍。
  • Terminal-Bench 2.1:CLM达到87.6%,高于Jev的83.1%和Pass@1的84.0%。CLM延迟仅32毫秒,Jev需要131毫秒,差距约4倍。

值得注意的一个关键事实:文章明确指出,Jev作为验证器在长程任务上表现低于随机选择的Pass@1基线。这意味着当任务从简单的多选判断升级为复杂的编码验证时,Jev的生成式决策架构暴露了根本性的缺陷。而CLM的对比学习架构,本质上就是把验证也当作一个匹配问题,反而天然更适合这个场景。

这一结果传递了一个清晰的信号:System One模型在验证器角色上的有效性,关键不在于模型有多大、思考有多久,而在于架构是否命中任务的本质。

非对称竞争:商业先行者 vs 开源颠覆者

当前CLM-8B和Jev之间的竞争格局,呈现出一个经典的非对称结构。

Jev的优势在于先发和生态:它定义了System One这个品类,有4000万美元弹药支持,有LangChain等框架的原生集成,有TypeSafe的API平台和付费模式。对于需要商业保障的企业用户,Jev是当前唯一的选择。

CLM的优势在于开放和可验证。Apache 2.0协议意味着任何团队都可以在自己的GPU上部署、审查、修改、再发布。CLM-8B甚至可以在一张RTX 4090上运行。API接口与Jev兼容,为Jev写的代码可以直接重放到CLM的后端,这意味着迁移成本几乎为零。开发者现在有了一个“先用CLM验证效果、再决定是否购买Jev”的选择权。

更深层的变量在于多模态方向。CLM团队已经在训练CLM-35B多模态版本,计划下月初发布。如果CLM能率先把System One范式扩展到图像、视频和机器人领域,它可能会在Jev触达不到的赛道上建立新的领先优势。

两段式AI:System One + System Two的混合未来

CLM的发布带来的最大启示,不是“CLM比Jev快”或者“开源打败了商业”。它指向一个更深层的趋势:AI系统的架构正在从“一个模型通吃一切”向“异构决策引擎的组合”演进。

在卡尼曼的人类认知框架中,System One处理90%到95%的日常决策,直觉、快速、自动化。System Two只在遇到复杂问题时才被激活,分析、计算、深思熟虑。两者的配合不是替代关系,而是分工协作。

AI Agent正在经历同样的分化。未来的Agent很可能不会只靠一个巨大的System Two模型从零推理每一个动作。更合理的架构是:System One模型(CLM/Jev)负责快速筛选、路由、评分,在几毫秒内把海量候选压缩到少数几个值得深究的选项;System Two模型(GPT、Claude等)只在真正需要复杂推理时才激活。这种混合架构既降低了整体延迟和成本,又保留了深度推理的能力。

CLM的论文还建立了对比学习模型的scaling laws,证明测试对比损失随训练计算量、模型规模和数据集规模按幂律递减。这意味着System One模型也有明确的规模扩展路径,不是一个“小模型取巧”的死胡同。

谁在受益,谁在焦虑

在这场范式迁移中,各方的处境截然不同。

TypeSafe面临一个经典困境:作为赛道的定义者和商业先行者,Jev的技术路线已经拿到强有力的外部验证,但同时,一个完全开源且在某些维度碾压自己的竞争对手已经在跑道上了。CLM的存在让Jev的商业化窗口从“独占”变成了“先发优势”。

Qwen和阿里系是意外的赢家。CLM选择Qwen3-8B作为骨干网络,为Qwen的开发者生态注入了全新的使用场景。一个被全球研究者选择作为System One模型骨干的品牌背书,比任何营销都更有说服力。

OpenAI、Google和Anthropic需要认真对待这个信号。在GPT-6 Sol和Claude Fable 5的时代,System One模型听起来可能像是一个“降级方案”。但如果Agent架构朝混合方向演进,System One做快速筛选、System Two做深度推理,缺少System One能力的模型厂商将在Agent效率和成本上处于结构性劣势。

而对于AI Agent框架和工具链而言,CLM和Jev的竞争反而是一个好消息。System One快速评分机制将推动Agent架构的底层重构,从“让LLM在循环中一次一次思考”变为“System One快速识别加System Two精准执行”的分层架构。这种架构升级会带动整个工具链的重新设计。

回到CLM-8B本身。它只是一个8B参数的模型,冻结的骨干网络加上两个仅仅75MB的投影头。它不写一个字的CoT。它在单张消费级显卡上就能跑。它用余弦相似度做决策。

更长的思考不一定更聪明。有时候,不思考才是最聪明的选择。

作品声明:内容由AI生成