AI Agent 正在企业数字化中快速落地,但一个尴尬的事实逐渐浮出水面:它们总在同一个问题上反复跌倒。Gartner 在 2025 年就警告过,超过 40% 的 Agentic AI 项目将在 2027 年前被取消。核心原因不是模型不够强,而是能力缺失无法被精准诊断和修复。斯坦福 Scaling Intelligence 实验室最新提出的 TRACE 系统给出了一套完全不同的解法。不是堆更多数据,而是把 Agent 的失败轨迹变成有针对性的强化学习训练场。在 τ2-Bench 上,TRACE 达到 47.0% 的通过率,比最强基线高出 7.4 个百分点,且随训练量增加持续提升,而传统方法早已停滞不前。
Agent 正在变强,也在变脆弱
2025 年 6 月,Gartner 发布了一份后来被反复引用的预测:超过 40% 的 Agentic AI 项目将在 2027 年底前被取消,原因包括成本飙升、业务价值不明确和风险控制不足。2026 年 7 月,Forbes 重新审视这个预测时发现了更尖锐的问题。大量 Agent 项目在 POC 阶段表现优异,一旦进入生产环境就频繁出错,而且总在同样的场景下、以同样的方式失败。
同一周,Prime Intellect 宣布完成 1.3 亿美元 A 轮融资,估值突破 10 亿美元,由 Radical Ventures 领投,NVIDIA Ventures、Intel Capital、Dell Technologies Capital 跟投。这家成立仅两年的公司专门帮企业构建自己的 AI Agent,据称年化收入已达约 1 亿美元。
市场对 Agent 的渴望是真切的,技术瓶颈也是真切的。
这两件事放在一起看,揭示了一个核心矛盾:Agent 正在快速进入生产系统,但行业还没有找到系统性地修复 Agent 能力缺陷的方法。
传统的 Agent 训练有两种主流进路。一是直接在目标环境上跑强化学习或监督微调。问题在于,当 Agent 在一个多步骤任务中失败,最终的奖励信号无法告诉它究竟是哪个具体能力的缺失导致了失败。就像一个学生做错了一道综合题,老师只打了个叉,却不告诉他是哪一步的哪个知识点没掌握。二是用大规模合成数据训练。但合成数据是广撒网,大部分算力花在了 Agent 已经掌握的能力上,真正缺失的能力反而得不到足够训练。
斯坦福 Scaling Intelligence 实验室的研究人员 Hangoo Kang、Tarun Suresh、Jon Saad-Falcon 和 Azalia Mirhoseini 在 4 月发表的论文中给出了一个截然不同的思路:既然 Agent 的失败是重复性的、可归因的,那为什么不把这些失败本身变成训练环境?
他们提出的系统叫 TRACE,全称 Turning Recurrent Agent failures into Capability-targeted training Environments。代码已以 MIT 许可证开源。
四步法:从失败中诊断,为缺失能力定制训练
TRACE 的核心理念并不复杂,但实现路径极具工程智慧。它把 Agent 训练拆解为四个自动化步骤。
第一步:对比式能力分析,找到 Agent 到底缺什么
TRACE 先让 Agent 在目标环境中跑大量的 rollout,把结果分为成功和失败两类。然后,一个 LLM 驱动的分析 Agent 逐条比对成功和失败的轨迹,给每条轨迹中的每个能力打上标签:NA(未涉及)、PRESENT(已掌握)、LACKING(缺失)。
这里对能力的定义很精妙。它不是指会写代码或会做客服这种大而化之的能力,而是指在一个任务轨迹中执行某个或某些动作,这些动作对于解决某个子集的任务是必要的。比如在客服场景中,检索正确的客户记录就是一个能力,取消航班、改座位、核实预订都需要它。如果 Agent 频繁在需要检索客户记录的任务上失败,TRACE 就会把这个能力标记为缺失。
TRACE 只保留那些同时满足两个条件的缺失能力:第一,它在成功和失败轨迹中的出现率差异必须超过 δ = 0.20(对比性阈值);第二,它在失败轨迹中的覆盖率必须超过 ρ = 0.10(覆盖度阈值)。这保证了 TRACE 只关注那些真正导致失败、且影响面足够大的能力缺失,而不是去修补那些偶发或边缘的错误。
第二步:靶向环境合成,给每个缺失能力造一个专属训练场
这一步骤最巧妙。TRACE 不是把 Agent 扔回原环境去训练,而是为每一个被识别出的缺失能力自动生成一个专用的合成训练环境。
这个合成环境保留了目标环境的工具接口、交互协议和输出格式,但只围绕这一个能力设计任务实例。任务实例由程序化生成器从随机种子自动创建,且 Agent 是否调用了目标能力可以通过工具参数、状态变化或最终输出来自动验证。不需要人工标注,也不需要 LLM 做裁判。
这意味着每一条训练轨迹的奖励信号都是精确的、可验证的:Agent 执行了缺失能力,获得奖励;没执行,受到惩罚。这和传统 RL 在目标环境中获得的稀疏奖励形成了鲜明对比。在传统方法中,Agent 可能成功完成了 90% 的步骤,只因为最后一步出错而得到零分,但它完全不知道错在哪一步。
第三步:LoRA 适配器训练,精准强化,不动基座
每个合成环境对应一个 LoRA(Low-Rank Adaptation)适配器,用 GRPO(Group Relative Policy Optimization)算法进行训练。基座模型全程冻结,只有适配器参数被更新。
GRPO 的一个关键设计是:它把共享相同随机种子的 rollout 归为一组,在组内归一化奖励。这样,同一个场景下的不同策略表现可以直接比较,训练信号更加集中,超参数调优也远比 PPO 简单。
第四步:MoE 组合,让 Agent 在推理时自动选择正确的能力
训练完成后,TRACE 把多个能力适配器组合成一个 MoE(Mixture-of-Experts)结构。在推理时,基座模型本身会对当前任务进行自然语言分类,判断需要哪个能力,然后激活对应的适配器。整个过程对用户透明。Agent 看起来仍然是同一个模型,但内部已经学会了在不同场景下调用不同的能力。
这整套流程,从自动诊断到靶向训练再到推理时路由,全部自动化,无需人工介入。
数据说话:TRACE 为什么比传统方法强
论文在两个基准测试上给出了令人信服的结果。
τ2-Bench(客服场景):TRACE 的总体通过率达到 47.0%,比基础 Agent 高出 14.1 个百分点,比最强的基线方法 GEPA(进化式提示优化)高出 7.4 个百分点。更重要的是,即使只训练一个能力适配器,TRACE 的表现也超过了直接在目标环境上跑 GRPO 的完整方案。
ToolSandBox(工具使用场景):TRACE 取得了 7 个满分成绩,比最强基线高出 4 个。
规模扩展行为:随着训练 rollout 数量从 0 增加到 5,120,TRACE 的通过率持续、单调地提升至 47.0%。而直接 GRPO 在 37.8% 就停滞了,GEPA 在 39.6% 也达到平台期。换句话说,TRACE 的算力投入效率更高,每增加一个 rollout,TRACE 比传统方法带来更多的能力提升。
能力数量扩展:TRACE 随着能力适配器数量的增加持续提升,4 个能力适配器时达到 47.0%。而 GEPA 的提示式方法很快饱和。因为提示优化的空间是有限的,而显式训练能力适配器的空间几乎没有上限。
Agent 训练范式正在从堆数据转向精准诊断
TRACE 的意义不只是一个技术方案。它代表了一种训练范式的转换。
过去几年,AI 训练的主流思维是更大、更多、更全。更大的模型、更多的数据、更全面的合成训练。这在预训练阶段是有效的,但在 Agent 的特定场景适配阶段,这种大水漫灌式的思路暴露了效率问题。你花了大价钱让 Agent 在各种能力上都刷了一遍,但真正缺失的那几个能力,可能只得到了微不足道的训练量。
TRACE 的底层逻辑是精准诊断加靶向治疗。它不试图让 Agent 在所有方面都变强,而是先找到弱点,然后集中火力解决。这听起来像常识,但在 AI Agent 训练领域,这恰恰是长期被忽视的维度。
一个更深层的启示是:Agent 失败中蕴含的信息密度,远高于成功。每一次失败都是一次诊断样本。成功的轨迹告诉你 Agent 做对了什么,但失败的轨迹告诉你 Agent 做错了什么、在哪里做错、为什么做错。这些信息远比成功信号更有价值。TRACE 的价值在于,它把这种原本被浪费的诊断信息,转化为可量化的、可训练的信号。
当然,TRACE 也有其局限。它依赖的能力概念需要 LLM 分析 Agent 来识别和标注,这意味着分析 Agent 本身的质量会影响最终效果。此外,在能力极度复杂、相互耦合的场景中,如何保证每个合成环境真正隔离了单一能力,仍然是一个需要持续验证的问题。论文目前没有展示在极端复杂场景下的表现,这是后续研究需要填补的空白。
但瑕不掩瑜。在 Agent 即将大规模进入生产系统的关键节点,Gartner 预测到 2028 年至少 15% 的日常工作决策将通过 Agentic AI 自主完成。TRACE 提供了一条务实的、可落地的路径。它不是要替代大模型,而是要让大模型在具体场景中变得更好用、更可靠。而这正是当前行业最迫切的需求。
Agent 的失败不是 bug,而是训练信号。谁先学会解读这些信号,谁就能在下一个 Agent 时代占据先机。






快报