整个行业都在说同一件事,但只有一家公司交出了存折。
当地时间 9 月 17 日,Anthropic 首次以量化方式公开了内部 AI 研发自动化的真实进度。数据比大多数分析师预期得更快:截至 2026 年 8 月,Claude 在公司 26% 的 AI 研发工作中已经处于“主导”地位——人类只负责给出高层指令和最终监督,Claude 端到端完成从方案到交付的绝大部分任务。而同年 2 月,这个比例还不到 1%。
半年从不足 1% 到超过四分之一。一条权杖交接的曲线已经画出了轮廓。
数字背后的工程真相
这组数字并非 Anthropic 自行定义。他们沿用了独立研究机构 Epoch AI 开发的六级自动化框架(Automation Level, AL),从 AL0(无 AI 参与)到 AL5(完全自主、无人在环)。其中三个临界点定义了这条曲线的阶段性:AL3 代表 AI“协作”——人在主导但 AI 能独立完成大块工作;AL4 代表 AI“主导”——人给定高层目标,AI 端到端执行,人类监督;AL5 则是彻底的无人化。
截至 8 月的数据显示:Anthropic 超过 90% 的 AI 研发工作已达到 AL3 或以上;26% 达到 AL4;AL5 尚未在任何被测量的类别中出现。
一个具体场景可以帮读者理解 AL4 的含义。Anthropic 在博文中用“夜间数据管道故障”做了典型案例:在 AL4 模式下,工程师只需要把故障告警和一句“修好它”交给 Claude,Claude 会自主查看日志、定位根因、编写修复代码、处理新冒出来的次级问题,最后重跑管道、对比输出结果、撰写事故报告。工程师不需要全程盯屏,只需在最后阅读报告并决定是否上线。而在 AL5——目前没人达到的级别——工程师连被告知都不需要。
博文同时披露的另两组数据同样重磅。Anthropic 内部 Agent 平台上,任意时刻约有 3 万个 AI Agent 同步运行,它们拥有独立身份标识,通过共享信息空间互相委派任务、交叉纠错。8 月,这些 Agent 累计产生超过 10 亿次独立决策。所有 Agent 动作在执行前都要经过在线监控,当月约 0.002% 的决策被阻止——相当于每 4.7 万次触发一次干预。离线监控每周标记约 10 万条对话记录进入自动化复审,其中最高优先级的大约 50 条会升级到人工审查。
在算力分配方面,Anthropic 首次做了精确记录:7 月 13-20 日的样本周内,投入 AI 研发的总算力中约 6% 用于安全研究;如果只统计 AI 驱动的研发部分,安全算力占比升至约 12%。但 Anthropic 也坦承这一数据存在偏差——那些同时提升模型能力和安全性的工作被归入了能力研发范畴。
RSI 竞赛:三方竞速
Anthropic 这组数据的冲击力,远不止于一次透明度操作。它指向了行业目前最深层也最危险的叙事:递归自我改进——当 AI 开始主导下一代 AI 的研发,研发效率曲线将从线性变为指数级。
Anthropic 发文前后的 72 小时内,恰好是这一叙事在行业层面最密集的自我证明。
9 月 6 日,OpenAI 宣布达到 Sam Altman 在 2025 年 10 月设定的目标:自动化研究实习生已经就位——一个能在人类指导下完成需要熟练研究员数天工作量的系统。到 8 月中旬,OpenAI 研究组织内部录得 3.1 个 agent 工作日对每个人类工作日,中位数研究员的推理算力消耗已超过每天 600 美元(按 API 价格计)。Altman 的下一个节点是 2028 年 3 月前实现自动化 AI 研究员。而 OpenAI 自己也坦承,最薄弱的环节仍然是“决定做什么”——任务一旦超过 4 小时,就需要人类频繁介入。
9 月 16 日,智谱创始人唐杰发布了 GLM-5.3-Flash 的部署案例。在超过 10 万颗国产 AI 加速器组成的集群上,从首次运行到承载全部生产流量只用了两周,端到端吞吐量提升约 3 倍。其中大量基础设施优化由 GLM-5.3 驱动的 Infra Agent 完成——Agent 自主排查了长上下文精度漂移、调用链 GIL 未释放、Decode 内核冗余计算等一系列典型问题。唐杰的判断是“我们还没有达到递归自我改进”,但“模型优化系统、系统服务模型”的最小闭环已经出现。
在硅谷的另一端,谷歌 DeepMind 的进化式编码智能体 AlphaEvolve 已从算法自动设计延伸到了实际的芯片电路优化。谷歌前首席科学家 Jeff Dean 曾在一场内部活动中将这一状态形容为“TPU 的大脑在设计下一代 TPU 的身体”。
谷歌 DeepMind 首席战略官 Jagjit Singh Chawla 此前的一句话点透了这轮军备竞赛的底层逻辑:RSI 正在成为 AI 资本开支的核心投资逻辑。虽然当前 AI 收入还撑不起正在投入的资本开支,但不下注 RSI 并不明智。
透明度本身就是一种竞争武器
Anthropic 这次披露的用心不止于信息透明。如果 Dario Amodei 此前发表的“前沿 AI 必须减速”倡议是在道德和监管层面踩刹车,那么这次量化公告就是在工程层面公开财报——把自己的核心指标摆上桌面,然后等着看谁不跟。
Anthropic 不仅公布了指标,还详细公开了方法论,并呼吁其他前沿实验室按相同框架定期披露,实现跨实验室横向比较。他们甚至计划邀请独立第三方进驻公司,访问内部系统和数据,对安全实践和度量标准进行独立验证。Anthropic 的赌注很简单:谁不跟,谁就在事实上承认自己追赶不上。
当然,这套框架也有其内在局限。Anthropic 坦承,“协作”与“主导”的边界存在主观判断成分。跨实验室比较需要各方对同一方法论的认同——而这在商业竞争环境下并非易事。更根本的问题是,Anthropic 用 Claude 来评估 Claude 的表现:Judge 和被判断者属于同一个模型家族,这是方法论上的天然局限。
即便如此,这组数据已经释放了一个不可逆的信号:在此之前,AI 研发自动化程度是每个实验室最核心的秘密之一;在此之后,它正被推向行业透明度标准。而这对于 OpenAI、Google DeepMind 等竞争对手来说,是一种比技术参数竞赛更加微妙也更具穿透力的压力——对手已经把牌摊开了,你的跟还是不跟,本身就是一种表态。
一个正在逼近的临界点
回到这组数据的核心含义。26% 还不是临界点——超过 50% 的研发由 AI 主导才是真正意义上的转折——但它已经跨过了“不可忽视”的门槛。
更值得关注的是加速度。从 2 月不足 1% 到 8 月的 26%,半年 26 个百分点。如果这个趋势持续不自然放缓,年底之前这个数字将逼近甚至超过 50%。当然,趋势也可能自然收敛——更困难的研发环节自动化门槛更高,安全约束也会主动踩刹车。但一个判断已经可以从数据中读出:递归自我改进不再只是论文里的猜想和播客里的谈资,它正在变成实验室里真实的任务看板。
当 AI 开始主导 26% 的自我研发,这意味着 26% 的研发工作已经不再受人类工程师的工时瓶颈限制。它可以在夜间跑,可以在周末跑,可以在人类休息的时候持续迭代。这是研发效率叠加上去的第一级飞轮惯性。
留给竞品判断和调整的时间,比大多数行业分析报告的预测窗口要短。






快报