当 Agent 学会「选技能」之前,必须先解决选择被惩罚的死循环

2026.08.20 18:40
上海交通大学与小红书团队的最新论文揭示了 Agent 技能选择训练中的一个结构性缺陷——selector credit starvation(选择者信用匮乏)。在 GRPO 的序列级 reward 框架下,正确选择被惩罚、错误选择被奖励,轨迹越长信号越失效。他们提出的 SkillGate 方案通过将 token 支撑集分割为两个不相交的信用通道,在 16 候选技能、5 个基准测试中,将 9B 策略的成功率从 40.8% 提升至 53.2%,误导候选暴露减少三分之二。

你以为教会一个 Agent 选技能,用强化学习给个奖励信号就行?上海交通大学和小红书团队的最新论文证明,这条路在结构上就行不通——正确选择被惩罚,错误选择被奖励,轨迹越长死得越惨。

2026年的 AI Agent 生态正在经历一场基础设施革命。曾经零散写在 prompt 里的过程知识,如今被系统地打包为可复用的「技能文件」。Anthropic 在 2025 年 12 月将其发布为开放标准,超过 40 个客户端完成集成。顶级技能仓库在 GitHub 上已斩获超过 20 万星标。OSSInsight 的数据显示,GitHub 上同时涉及 agent 和 skill 的仓库,从 2023 年的 17 个暴涨到 2026 年第一季度的 23,900 多个。

技能库的规模从几十个冲向数千个。Agent 在执行长周期任务的中途,必须回答一个看似简单的问题:「这个时刻,我该读哪份技能说明书?」

这不是工程问题,而是训练问题——且到目前为止,整个行业都没有正确的解法。

用 RL 训选择,一个天然死胡同

乍看之下,这个问题有现成的工具箱:强化学习。让 Agent 在候选技能列表中做选择,用最终的结果奖励来训练选择策略。这是 RL 的经典套路,GRPO(Group Relative Policy Optimization)更是 DeepSeek-R1 验证过的成熟框架。三家各自独立的工作——SkillRL、Skill1 和 SkillRise——都尝试过这条路线,用任务级 reward 同时训练技能的构造、选择和利用。

但 SkillGate 论文的作者们发现了一个令人不安的事实:这条「默认路线」在结构上就不成立。

他们通过数学分析和实验验证,揭示了一个他们称为 selector credit starvation(选择者信用匮乏)的结构性缺陷。问题出在 GRPO 的信用分配机制上——当一个 trajectory(完整执行轨迹)的最终 reward 被「广播」到序列中的每一个 token 上时,命名所选技能的那几个 token 承载的梯度份额接近于零。论文审计了 12,800 条在策略轨迹的训练制品,发现选择 token 在一条轨迹中占到的中位数比例仅为 0.14%。随着轨迹变长,这个份额还会进一步稀释数倍。

更致命的是符号反转。由于序列级 advantage 不分青红皂白地覆盖所有 token,Agent 在开头正确选择了技能 A,但后续执行因为环境复杂而失败——那几次正确选择的 token 会受到惩罚。碰巧选错但执行蒙混过关,反而得到奖励。论文发现每五条正确选择的轨迹中,就有两条的 token 接收到负 advantage。在最长的轨迹上,正确选择被惩罚的频率已经超过了被奖励的频率。

这还不是全部。论文还证实了第三个性质:在相同 prompt 分组内,正确选择带来的任务成功率价值高达 +11.2 个百分点。一个对结果如此关键的决策,得到的训练信号几乎是零,且多数时候还带错了符号。这三种性质,每一种都随 horizon 单调恶化。

这种「信用匮乏」不是数据不足或调参失误——它是 GRPO 这类序列级 reward 结构的天然数学缺陷。

为什么 GRPO 不能训练选择决策

GRPO 之所以成为 DeepSeek-R1 等推理模型训练的主力框架,恰恰因为它去掉 critic 网络,用组内相对 reward 替代值函数估计,大幅降低了内存开销和训练不稳定性。这个特性在数学推理中表现极其出色。

但推理和 Agent 任务有一个根本差异。推理时,Agent 从头到尾在同一维度的「思维空间」中运作——每一 token 都在为推理链条做贡献,用同一个序列级 advantage 没有问题。而在 Agent 场景中,Agent 面临的是异质性决策:选择「读哪个 skill」是一个离散的、发生在极早阶段的分类决策(大约 5-10 个 token),后续基于 skill 的执行是序列的、步骤密集的连续决策(数百到上千 token)。

本质上,这是两种不同的认知操作,被强行打包进同一个序列级 reward 信号。

论文通过对训练制品的系统性审计,精确量化了这个冲突。在 0.14% 的 token 占比下,选择 token 的梯度贡献几乎可以忽略不计。而符号反转效应随 horizon 线性增长——当任务从 10 步拉长到 30 步时,选择 token 获得正确符号信号的概率从 60% 以上跌到不足 30%。

此前已有工作触及 GRPO 在长周期任务中的信用分配问题,但 SkillGate 是第一个精确命名并解决「技能选择」这一特定子问题的。

Agent Skills 生态爆发让选择问题变得不可回避

要理解 SkillGate 解决的是哪个时间窗口的问题,需要先看整个 Agent Skills 生态在过去 10 个月里发生了什么。

Anthropic 在 2025 年 12 月 18 日正式发布开放标准 agentskills.io,配套的 spec 仓库拿下超过 2.3 万星标。到 2026 年中,超过 40 个客户端完成集成——Claude Code、OpenAI Codex、Gemini CLI、GitHub Copilot、Cursor、VS Code,几乎覆盖了所有主流 AI 编程工具。微软在 2026 年初推出了包含超过 130 个模块化技能的官方仓库。Vercel 的 skills.sh 平台在 2026 年 1 月上线,迅速成为最大的技能分发中心之一。

个人开发者生态更是惊人。mattpocock/skills 在 2026 年 4 月已突破 20.3 万星标,一个作者占据了全球安装量前十中的五个位置。排名第一的 Superpowers 技能集合有 26.6 万星标。GitHub 上已有超过 5.7 万个 AGENTS.md 文件和 3.1 万条 skill 定义存放在 .claude/skills/ 目录下——这些数据来自 OSSInsight 的统计,发布时间是 2026 年 3 月 24 日。

当技能库只有三四个时,Agent 靠简单的描述匹配就能应付。但当公共库开始向数百乃至数千膨胀,技能之间描述重叠、功能交错,「选哪个」就从 trivial 问题变成了核心瓶颈。此前 SRA-Bench 的研究已经发现,基础模型在数千个任务配对 gold skill 时经常加载错误;Canary Tools 的测试更表明,植入诱饵技能能系统性地暴露 Agent 的选择盲区。

行业正在以极快速度构建「技能供给侧」,但「技能选择侧」的训练方法论几乎一片空白。SkillGate 填补的正是这个空白。

SkillGate:两个信用通道,一次 GRPO 更新

SkillGate 的解决方案在数学上简洁至极:将 token 的支撑集分割为两个不相交的信用通道。

第一个通道承载「结果信用」——来自 trajectory 最终 reward 的序列级 advantage,只流向执行 token,即那些实际调用技能、与环境交互的 token。第二个通道承载「独立的局部 action advantage」——基于一个简单的判定:本次技能读取是不是当前 trajectory 中唯一的、位置正确的那个选择。这个局部 advantage 只流向命名所选 skill 的那几个 token,而且只有当该 skill 读取确实正确时才为正。

两个通道在同一个 GRPO 更新步骤中并行运作,互不干扰。

这个设计的精妙之处在于它没有推翻 GRPO 框架——事实上 SkillGate 完全兼容 GRPO——而是纠正了 GRPO 在异质性决策场景下的信用分配盲区。执行部分继续享受 GRPO 的组间相对优势估计,而选择部分获得独立的、不随 horizon 衰减的局部信号。论文把这种分离的哲学提炼为一句清晰的判断:

「两个决策由不同的证据来评判——命名了正确的文件,从候选清单本身就能知道;而工作做得好不好,只能从最终结果来判断。把它们混入同一个 advantage,等于让每一个信号都被对方污染。」

效果如何?在 5 个标准 Agent 基准测试、16 技能候选的设定下,9B 参数的政策网络基线为 40.8% 的试次成功率。用同等预算的纯结果奖励 RL 训练,几乎没有提升——这正是 selector credit starvation 的实证体现。SkillGate 将同一 9B 政策推到了 53.2% 的成功率,净增 12.4 个百分点。同时,Agent 暴露给误导候选的频率降低约三分之二,整体技能读取次数也更少——它学会了更精准地选择,而不是更频繁地选择。

论文作者已将代码和模型全部开源,代码仓库在 github.com/DeepExperience/SkillGate,9B 模型权重可在 HuggingFace 平台获取。

从「R1 时刻」到「Agent 时刻」

SkillGate 的深层意义超越了一篇论文的技术贡献。它暗示了 Agent RL 训练的一个范式转折。

过去两年,尤其是 DeepSeek-R1 发布以后,GRPO 及其变体几乎成了 LLM post-training 的标准答案。但凡需要训练 Agent 做长周期任务,GRPO 默认是第一选择。但 Agent 场景和推理场景的根本差异正在被越来越多的工作揭示——推理是「一条线走到黑」的连续认知过程,Agent 是「选择-执行-再选择-再执行」的离散决策序列。把同一个框架不加区分地套用到两个场景上,SkillGate 证明了至少在技能选择这个具体问题上,这条路走不通。

这个洞察与上海交通大学团队此前的工作一脉相承。2026 年 4 月,同属张伟楠教授团队的另一篇论文曾以「外部化」为统一视角,系统梳理了 LLM Agent 的记忆、技能、协议与 Harness 工程四大支柱,指出 Agent 的实际进展越来越取决于模型之外的外部认知基础设施,而非模型本身的能力提升。SkillGate 可以看作这条研究路线的自然延伸:当技能被外部化为独立文件后,如何训练 Agent 在「外部大脑」中做出正确的选择,就成了一个必须解决的新问题。

巧合的是,就在 SkillGate 提交 arXiv 的几乎同一时间,多条独立的研究线索也在逼近类似的答案。Skill1 框架提出了用单一任务结果信号同时训练技能选择、利用和蒸馏的方法;SkillRise 从另一个角度尝试了同类目标。这些工作形成了一个有趣的三角:选什么技能、怎么用技能、怎么造新技能——三者必须协同进化,而不能各自独立优化。

不做选择的代价,比选错更大

Selector credit starvation 这个概念的提出,让行业第一次有了一个精确的术语来描述「为什么用 RL 训 Agent 选技能总是不对劲」。有了名字,才有正确的诊断和治疗。这恰恰是科学进步的经典模式:问题命名本身即贡献。

对从业者而言,SkillGate 带来的启示是具体的。如果你在用 GRPO 或其变体训练 Agent 做长周期任务中的技能选择,建议立即检查选择 token 的梯度信号。如果信号在训练过程中衰减到接近零或有系统性符号反转,那大概率不是你的实现有问题,而是框架本身的结构性限制。

Agent Skills 生态正在快速走向专业化,技能库的管理和选择将成为 Agent 系统的核心能力而非附属品。这意味着 Agent 架构需要从「一个模型加一个 prompt」转向「一个选择器加一个执行器加一个技能库」的三元组。SkillGate 提供的双向信用通道设计,为这种架构的训练提供了可行的起点。

更值得警惕的是,不要迷信「推理领域的成功等于 Agent 领域的成功」。DeepSeek-R1 证明了 GRPO 在推理任务上的威力,但 Agent 任务有着完全不同的信用分配拓扑。把 RL 算法从一个领域搬到另一个领域之前,先检查它的 advantage 信号是否在你的任务结构中有意义。

一个具体的发现最能说明问题:论文团队在最长轨迹测试中发现,纯 GRPO 训练的选择策略性能不仅没有提升,反而比随机选择更差。这听起来反直觉,但道理很简单——正确选择被反复惩罚后,Agent 学会的是「不要做选择」而不是「做正确的选择」。

这种惩罚式学习的陷阱,在序列级 reward 结构下几乎是不可避免的。SkillGate 的贡献不是给了 Agent 一个更好的选择器,而是给了它一个不被惩罚的选择权。

当技能库从几十个膨胀到成千上万个,当每个 Agent 都需要在数十毫秒内决定读哪份技能说明书,那个选择不再是一个实现细节,而是整个系统智能密度最高的决策节点。不给这个节点正确的训练信号,堆更多的技能、更大的模型,都只是在一座地基不稳的大厦上加盖楼层。

SkillGate 以一道简洁的数学手术,把 Agent 从「做了正确的选择却挨了罚」的死循环里救了出来。在 Agent 生态全面爆发的前夜,这个时机,恰到好处。

作品声明:内容由AI生成

快报

更多

11:29

富达国际回应“退出中国”传闻:在华战略和市场布局没有变化

11:28

财政部:下半年还有2万多亿元的地方政府专项债和超长期特别国债待发行使用

11:26

中国印尼全面战略对话机制首次会议在雅加达举行

11:23

今年以来消费品以旧换新政策惠及1.78亿人次

11:22

爱奇艺CEO龚宇:将坚定All in AI战略

11:22

GLM-5.3、DeepSeek-V4-Pro正式版接入千问AI平台

11:22

张雪回应“台湾首辆张雪机车遭查扣”

11:19

下半年财政部将及时谋划出台务实管用的增量政策

11:16

古巴谴责美国对古新一轮制裁

11:15

中汽协:7月中国品牌乘用车共销售175.4万辆,同比增长9.3%

11:10

财政部等三部门:将符合条件的中小微民营企业的新发放流动资金贷款纳入中小微企业贷款贴息政策支持范围

11:06

摩尔线程张建中:智算集群向十万卡规模演进已成必然趋势

11:04

管涛出任华福证券首席经济学家

11:02

财政部:将动态调整进口暂定税率,自主优化完善关税税目,支持进出口贸易

10:58

阿里最新财报:速卖通实现盈利

10:55

Akamai 推出 Workforce Protector

10:52

财政部:中长期将通过提升社会保障能力、收入分配制度改革等再分配调节,提升居民消费能力

10:51

资金再次转向,股票ETF昨日净流出33亿元

10:50

韩国现代汽车工会时隔10年举行全面罢工

10:48

财政金融协同促内需一揽子政策已惠及企业622万家、居民1.13亿人次