模型不换、能力不减,英伟达让AI编码Agent的Token消耗砍半

2026.09.26 20:26
英伟达最新论文SoL-Pi证明,在不更换底层模型的前提下,通过自动优化编码智能体的harness(控制层),可以将Token用量减少49%,同时保留93.7%的原始性能。当agentic token用量半年暴增14倍、企业AI编码成本持续攀升之际,英伟达找到了一个被行业长期忽视的效率杠杆——不是模型的智力,而是智能体的"骨架"。

一个编码智能体跑得越久,越贵。这不是模型的问题——同一个模型,同样的能力,仅仅因为控制它怎么用工具、怎么读反馈的那层胶水代码写得不够聪明,Token账单就能翻上一倍。英伟达最新论文SoL-Pi给出了一个反直觉的答案:换模型,不如改骨架。

这背后是一场正在加速的行业焦虑。OpenRouter分析师Peter Walker的统计显示,截至2026年9月,Agentic Token用量自2月以来增长了14倍,其中近70%来自缓存提示词。当企业开始按小时为AI编码助手支付数百甚至上千美元时,一个此前被忽视的问题浮出水面:AI编码智能体的成本黑洞,到底藏在哪里?

长期以来,行业对编码智能体的优化思路高度统一:让模型更快、更便宜。更高效的注意力核、量化和蒸馏、换成更廉价的小模型——所有路数都指向“降低每Token成本”这一条。但英伟达SoL-Pi的研究者选择了一条截然不同的路径:模型不动,去改模型与环境之间的那层“汁架”。

被遗忘的操作系统

Harness,中文可译为“汁架”或控制层,是编码智能体中连接语言模型与外部环境的中间层。它决定智能体如何感知当前状态、如何执行动作、如何处理环境反馈。你可以把它理解为智能体的操作系统——虽然不直接产出“智能”,但它决定了智能的运转效率有多高。

Codex、Claude Code、OpenClaw——这些知名编码智能体都依赖各自的harness实现。然而,优化harness从来不是一件容易的事。工具调用、上下文管理、验证逻辑、中止策略——这些组件紧密耦合,牵一发而动全身。一个在某环节省下Token的操作,可能在另一环节引发连锁错误,或只是把成本转移到了后续阶段。过去,这项工作只能靠工程师人工翻阅长长的执行日志,把重复出现的失败模式翻译成代码逻辑。

SoL-Pi的突破在于:它让AI自己来完成这件事。

152个方向、3000次运行:AI在替自己“减肥”

SoL-Pi的核心是一个自动研究循环。一个“研究智能体”持续观察另一个工作智能体的执行轨迹,提出改进方案,在沙箱环境中测试验证,并通过能力与效率的双重检查筛选出有效的候选项。

研究团队为此构建了535个可执行环境,让系统探索了152个优化方向。这些方向覆盖了495个从GitHub issue-PR对衍生出的任务和40个合成测试用例。整个探索过程产生了超过3000次运行和6万次以上的智能体-环境交互。

搜索规模看起来不小,但更大的搜索并不自动意味着更好的结果——事实上,此前的研究表明,自动优化的harness容易过拟合到训练任务上,在陌生场景中几乎毫无用处。SoL-Pi的解决方法是严格分离搜索反馈与评估。研究者将EdgeBench作为测试基准,完全隔离于搜索流程之外。51个公开任务中,仅11个用于候选方案的一次性验证,剩下40个全部保留用于最终评估——评估结果从未回流到搜索过程。

经过层层筛选,四个机制最终存活下来。

Action Fusion(动作融合)。将两个连续步骤合并为一步——比如一次代码编辑紧跟一次测试运行——直接省去一次大模型调用。

Online Context Compact(在线上下文压缩)。在每个规划步骤完成后运行,在不丢失重要信息的前提下修剪累积的上下文。

ObservationPack(观测打包)。将长时间运行的工具输出存档,后续步骤中只传递简短摘要而非每次重复发送完整文本。

Evidence-Preserving Reducer(证据保全精简器)。将大型错误日志和测试日志路由到更便宜的模型进行摘要,同时配以自动验证步骤来捕获被遗漏的关键线索。

四个机制覆盖了智能体工作流的全部阶段:从动作执行到上下文管理,从输出存储到日志处理——对应着编码智能体Token消耗的四大源头。

Token省一半,能力保九成

在EdgeBench的51个公开任务上,起始harness Pi使用GPT-5.6 Sol的总Token为21.54亿,API成本1339美元,平均得分44.8。完整SoL-Pi(四个机制全开)仅消耗10.99亿Token,成本降至894美元,得分为42.0——Token用量减少49%,成本下降33.2%,保留了Pi原始得分的93.7%。

换算成每小时成本更直观:相比原生Codex和Claude Code的harness,SoL-Pi每小时可节省8.75到13.50美元;相比Pi,每小时可节省4.36到5.71美元。

研究者用GPT-5.6 Sol完成了全部优化后,将整个harness未经任何修改直接套用到Claude Opus 5上。迁移测试中,SoL-Pi保持了Pi 94.3%的平均得分,Token流量减少44.7%,API成本降低33.5%。这是一个有力的证据,证明优化并非针对单一模型的过拟合,但Opus 5下各机制触发频率有所降低——harness毕竟是在GPT-5.6 Sol的轨迹上优化的,它更懂“自己人”的习惯。

值得注意的还有一个微妙权衡:上下文压缩在减少Token的同时,也降低了提示缓存的命中率。效率最高的变体节省49%的Token,但其成本节约“只有”约三分之一,差距就来自这里。

出了EdgeBench,成绩开始分化

SoL-Pi在EdgeBench上的表现无可挑剔,但在更广泛的基准测试中,情况更加复杂。

在Terminal-Bench 4的63个CPU任务中,SoL-Pi只解决了15个任务,而Codex和Pi各解决了18个。不过总成本仍然比Pi低了约四分之一。在2026年IMO数学奥林匹克竞赛的Lean 4形式化验证任务中,SoL-Pi以每题最低成本解决了6道题中的3道。在一项内核优化实验中,20个SoL-Pi工作节点的集群相比同等规模的Pi集群,成本降低了26.8%。

换言之,SoL-Pi并非万能药。对某些类型的任务,它的最优方案未必胜过人工精心调校的传统harness。但在那些它能胜任的场景里,它以极致的Token效率证明了“工程优化”比“模型升级”更有性价比。

一场围绕智能体骨架的竞赛已悄然展开

SoL-Pi不是最近唯一在harness层面做出突破的工作。就在论文发表的同一周,AWS发布了Strands Harness,宣称使用相同模型时成本比Claude Code低77%。DeepSeek则拥有目前Token效率最高的harness之一。而SoL-Pi的论文背后,来自MIT、普林斯顿、清华和英伟达的14位研究者,揭示了一个更宏大的方向。

论文结尾,他们提出了一个更具野心的愿景:像预训练模型一样跨任务预训练harness,然后用已经足够精简的harness去搜索它的下一代——实现递归式的效率改进。研究者自己也承认,这是一个愿景,而非本研究的正式结论。但这条路径本身已经足够说明行业趋势的转向。

当Scaling Law开始放缓,模型性能差异在收窄,智能体之间的胜负手正在向工程层面迁移。模型的智力固然重要,但决定智能体大规模落地成本的,是模型“怎么被用”的那层代码——是harness在多大程度上减少了废话、合并了冗余、压缩了记忆。

在笔者看来,SoL-Pi真正的价值不在于省掉了多少Token。它揭示了一个更深层的产业逻辑:当模型能力趋同,定义差距的将是工程。AI编码智能体在真实世界的部署中,瓶颈从来不在AI的大脑,而在AI的神经末梢。

谁先学会让智能体干活时不讲废话,谁就赢了一半。

作品声明:内容由AI生成