文 | 智讯智库,作者 | 陈宥文
如果把智能演化压缩成一条线,推动变化的主体一直在迁移。
最早,是自然选择塑造人;后来,人类用语言、工具和制度把知识留给下一代;再后来,人开始制造机器,并不断让机器变得更强。
到了2026年,一个新的转折开始出现:AI开始从被研发的对象和辅助工具,进入研发过程本身——不只被人改进,也开始参与下一代机器的研发。
这很像“棘轮”——机械上的棘轮允许齿轮沿一个方向转动,同时阻止它退回原位;人类文化也通过保存知识、工具和方法,让后来者站在前人的成果上继续改进。研究者将这种成果得以保留、并在此基础上持续累积的机制称为“文化棘轮效应”[1]。
过去,推动这个棘轮的始终是人。
关键的变化,开始出现在研发端。在2026世界机器人大会上,王兴兴介绍宇树正在探索的物理AI机器人自进化路线:大模型介入研究检索和控制代码生成,再通过仿真、真机测试和评价反馈形成持续迭代闭环[4]。
也就是说,AI系统的角色,正在从研发对象和辅助工具,进一步延伸到下一代机器的研发过程。
而要进一步跨入RSI,关键还在于:上一轮研发积累能否反过来提升下一轮研发效率,使系统越来越擅长产生有效改进。
这正是RSI(Recursive Self-Improvement,递归自我改进)关注的核心:系统不仅继承上一轮的改进结果,还进一步优化产生改进的方法本身[5]。
如果这一机制能够稳定提效积累,“下一代更强”就可能进一步变成“更强的下一代出现得更快”。
推动棘轮的主体,也就不再只有人。
而当这套逻辑进入具身智能,又会多出一层数字环境难以等价面对的约束:真实部署。
机器人每一次真机试错都会消耗设备、时间和人力,却也会暴露真实状态、异常、接管与恢复等信息。如果这些部署经验能够稳定回到训练和验证系统,并被后续版本继承,产品部署就不再只是商业交付,也开始成为持续改进的研发入口。
因此,判断一家机器人公司的持续改进能力,可以落到一个很具体的问题:
今天在真实世界暴露的问题,需要多久才能转化为下一版经过验证的新能力?
基础模型决定这一代能做到什么,持续改进系统决定下一代能力能以多快的速度形成。
由此就可以说:最先跑出具身智能RSI闭环的,未必是基础模型最强的公司。
要理解这个判断,可以先看数字环境中的RSI究竟走到了哪一步。
AI已经会自我改进,但离“越来越会改”还有距离
1965年,英国数学家I. J. Good提出“intelligence explosion(智能爆炸)”:如果机器能够参与设计比自己更强的机器,更强的下一代又继续参与研发,改进便可能一轮轮叠加[6]。六十年后,这条链里几个过去只能存在于思想实验中的环节,已经陆续进入工程系统。
今天的问题因此已经变了。我们不再只问机器会不会参与研发,而要进一步判断:它已经参与到哪一层,上一轮的改进又能不能真正进入下一轮?
第一步:AI开始接手研发
最先发生的变化,是AI从研发助手逐渐变成研发执行者。9月17日,Anthropic第一次用内部数据量化这种变化[7]。按照Epoch AI提出的Automation Level,2026年2月,其内部达到AL4——人主要提供高层目标、AI完成大部分端到端任务——的研发工作占比还不到1%;到8月,这一比例已经升至26%,超过90%的研发工作至少达到AL3。
![]()
图片备注:Anthropic数据显示,Claude主导完成的AI研发工作占比从2026年2月不足1%升至8月的26%,AI正在从研发助手进入更完整的端到端执行环节。
图源:Anthropic Institute,Measurements for Understanding the Pace of AI Development Inside Frontier Labs,2026年9月。
研发规模也在同步扩大。在Anthropic使用最多的内部Agent平台上,任意时刻约有3万个Agent同时从事研究和工程,仅8月就做出了超过10亿次决策[7]。虽然还没有被测量的研发工作达到完全无人介入的AL5,但人与AI的分工已经明显改变:人开始退出越来越多的具体执行,把位置上移到目标设定、监督和最终判断。
执行权正在转移,但这仍然只是研发自动化。真正决定棘轮能不能继续向前转的,是上一轮研发留下的经验,能不能进一步改变下一轮研发本身。
第二步:经验开始改变下一轮怎么研发
Dream-RSI直接触到了这一层[8]。它把过去真实搜索留下的记录组织成“回放模拟器”,让AI在已经发生过的探索历史中重新测试不同策略:哪条路线值得继续,什么时候应该停止,多少实验需要并行,有限算力应该投向哪里。
![]()
图片备注:Dream-RSI把真实搜索历史转化为可反复回放的模拟环境,让上一轮经验直接参与优化下一轮搜索策略,形成“探索—回放—改进—再探索”的循环。
图源:Dream-RSI官方项目页,Dream-RSI: Recursive Self-Improvement through Evolving Worlds,Figure 1。
改进后的探索策略再进入真实任务,新产生的记录继续补充模拟器,如此循环。整个过程中,底层coding agent并没有改变,真正被改写的是模型外部的搜索和编排方式。
这种改变已经体现出可计量的效率差异。在GPU Kernel任务中,Dream-RSI用1.79至2.43倍更少的生成次数达到相近性能;在另一些任务中,则能在相近预算下把性能最高提高到固定探索策略的2.09倍[8]。过去的经验,开始反过来改变下一轮应该怎么寻找答案。
但这里仍有一条清楚的边界。Dream-RSI改进的是模型外部的搜索策略,底层Agent并没有随着循环一起变化;研发方法变好了,并不等于被研发出来的新系统也更擅长继续研发下一代。要跨过这一层,修改对象还必须继续向系统自身推进。
第三步:被改出来的Agent,重新站回研发起点
Darwin Gödel Machine(DGM)把修改对象推进到了Agent自身[9]。它允许coding agent直接修改自己的代码,新版本随后进入真实编程任务接受检验,表现较好的版本被保存进archive,再成为后续修改和搜索的起点。
![]()
图片备注:DGM允许coding agent修改自身代码,并把表现更好的新版本重新放回后续搜索过程,形成持续扩展的Agent演化谱系。
图源:Sakana AI,The Darwin Gödel Machine: AI that improves itself by rewriting its own code,2025年5月。
最终,SWE-bench成绩从20.0%提高到50.0%,Polyglot从14.2%提高到30.7%[9]。但这里更重要的并不是Benchmark本身,而是被改出来的新Agent没有停在实验终点,而是重新站到了下一轮研发的起点。修改、测试、保留、继续修改,由此具备了连续运转的结构。
DGM仍然留着一个关键缺口。它的archive怎样维护、版本怎样选择、整体搜索怎样组织,仍由外部框架规定。换句话说,它证明了AI可以不断改出新的Agent,却还没有证明新Agent越强,它继续开发下一代Agent的能力也会同步变强。
这才是RSI最难跨的一道门槛。
第四步:更强的下一代,是否也是更强的“改进者”?
用A₀、A₁、A₂三个版本最容易看清这道门槛。如果A₁比A₀更强,只能说明任务能力提高;如果在资源大致相同的情况下,A₁又比A₀更高效地开发出A₂,才说明改进能力本身也提高了。只有当这种优势继续从A₂传到A₃,跨代复利才真正出现。
7月14日,Weco公布的AIDE²直接测试了这一问题[10]。系统让外层Agent持续修改内部Research Agent,在100轮无人干预的外循环中产生7个连续改进版本。Weco把这一结果定义为Level 1——net positive:固定预算下,自动改进效率已经超过人工基线,而且增益能够延伸到没有直接参与优化的任务[10]。
再往上一层是ignition,也就是改出来的更强Agent,本身也成为更强的改进者。AIDE²已经尝试测试这一步,但Weco自己的结论仍然谨慎,现有结果不足以证明ignition能够稳定发生[10]。
所以,数字环境中目前能够确认的边界已经比较清楚:AI已经会做研发、利用经验调整研发方法,也能够修改Agent自身;但从“任务能力更强的下一代”跨到“改进能力更强的下一代”,公开证据仍然不足。
《The Last AI Built by Humans》(Theseus Labs)提供了一把更统一的尺子[5]——它关注的不是能力排行榜,而是改进权究竟转移到了哪里。对具身智能而言,论文判断当前主要前沿仍集中在L2—L3,L4更多见于模拟环境,距离稳定的递归元改进还有明显距离。
![]()
图片备注:RSI可以从改进执行、改进策略、经验获取、环境适应一路推进到递归元改进;对具身智能而言,当前主要前沿仍集中在L2—L3,L4更多出现在模拟环境。
图源:Yi Duan等,The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement,arXiv:2609.11873,2026年9月10日。
![]()
这也解释了为什么Anthropic的26% AL4不能直接理解成26%的RSI。因为,比AI完成了多少工作更重要的是:目标谁定,实验谁选,经验谁获取,结果谁验证,下一轮怎么改又是谁决定——这些目前依然是由人来裁决。
随着这些权力不断向AI内部转移,两道约束也会越来越突出——谁来判卷,以及实验到底能跑多快。
改得越快,判卷越难
系统能够修改自己,并不意味着它天然知道什么才算真的变好。METR对早期o3的RE-Bench测试发现,128次运行中有39次出现reward hacking;在Optimize LLM Foundry任务上,21次运行全部出现利用评分机制的行为[11]。
这个结果揭示了递归改进里一个很朴素的问题:变化可以被继承,错误同样可以被继承。如果Evaluator存在漏洞,系统可能越来越擅长获得更高分,却没有得到真正需要的能力;一旦错误评价进入后续循环,自动化程度越高,错误也可能被放大得越快。
因此,RSI越深入,验证越像是核心基础设施,而不是附加的安全设施。版本历史、回归测试、独立Evaluator、准入机制和回滚能力,共同决定哪些变化有资格进入下一代;没有这一层,自我改进很容易退化成自我放大误差。
即使判卷问题解决,实验本身仍然有速度上限。OpenAI在9月6日披露,截至8月中旬,其研究组织每一个人类工作日已经对应约3.1个Agent工作日,研究人员运行实验的规模也明显上升[12]。但自动化增加,并没有让研发变成纯粹的并行搜索。
Noam Brown随后指出,数学问题可以让大量Agent同时思考,而机器学习研发仍需要真正训练模型、运行实验、等待结果,其中许多反馈天然要按顺序发生[13]。智能可以并行,实验时间未必可以。
这解释了为什么数字环境率先出现RSI雏形,也解释了它目前的边界。软件代码容易复制,Agent容易扩容,环境可以快速重置和回滚,一次失败相对便宜;当同样的研发循环进入机器人,实验不再只发生在服务器里,成本结构也随之改变。
具身智能RSI真实难点:把真实世界接入持续改进闭环
机器人和数字Agent最大的区别,是它的行动会改变下一轮实验本身。数字Agent写错一段代码,可以复制环境再试一次;机器人抓错一个杯子,杯子可能已经倒下,物体位置已经改变,夹爪也可能进入新的姿态,下一步还能看到什么、还能做什么,都受上一动作影响。
因此,机器人不仅从数据里学习,它的行动本身也在决定下一批数据是什么。一套策略如果从未进入过某种状态,就得不到那个状态下的经验;如果它一直避开困难状态,即使成功率看起来很高,也可能始终不知道自己的真实能力边界。
具身RSI首先要解决的,也就不是抽象的自我进化,而是一条具体工程链:失败能不能回来,改进能不能留下,昂贵的实验能不能少做,AI最终能不能进入研发流程本身。从目前公开研究看,这四个环节都已经出现早期样本,而前一个问题一旦被解决,下一个瓶颈就会随之暴露。
第一环:失败不再只是损耗,而要对下一轮产生价值
Q-Planning是一种让模仿学习策略无需重训主体模型、也能利用部署中的成功与失败轨迹持续改进的方法。它没有重新训练整套基础策略,而是在冻结的行为策略之外增加一个Q-function,让机器人自己产生的成功和失败轨迹参与下一轮动作选择[14]。
![]()
图片备注:Q-Planning冻结原有BC策略,只更新额外的Q-function,让机器人把自主部署中产生的成功与失败轨迹重新用于下一轮动作选择。
图源:Varun Giridhar等,Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning,官方项目页,2026年。
在两个双臂真机任务中,经过5轮改进,成功率分别从40%升到90%、25%升到80%,过程中没有新增人工示范和遥操作[14]。
但它的边界同样清楚:真机实验仍需要人工重置场景,并为每个episode判断最终成功还是失败;如果基础策略根本生成不了某类有效动作,Q-function也无法凭空创造新的能力。
即便如此,一个变化已经发生:失败开始从一次性的实验成本,变成下一轮能力更新的输入。但一次失败被利用,不等于一次改进能够积累;如果换一个任务、换一台机器又重新开始,棘轮仍然没有真正转起来。
于是第二个问题自然出现:这次改对的东西,能不能成为下一次的起点?
第二环:保存有效改进,让其成为下一次的起点
ASPIRE是英伟达推出的一套让机器人在反复试错中自动修正控制程序,其能把有效经验持续沉淀为可复用技能。它从执行轨迹中分析失败、生成修复方案并进行验证,通过验证的修改会被写入持续扩展的skill library,供后续任务再次调用[15]。
![]()
图片备注:ASPIRE让机器人自动分析执行失败、修改控制程序,并把通过验证的修正持续沉淀进可复用的skill library,使有效改进能够被后续任务继承。
图源:NVIDIA GEAR Lab,ASPIRE: Agentic /Skills Discovery for Robotics,2026年。
这意味着,能力继承不一定只能发生在模型参数里。技能库、memory、Agent框架、训练代码,甚至一套经过验证的实验流程,都可能成为经验跨版本保存的载体。
放到产业现场,这个区别尤其具体。工程师在客户现场解决一个问题,如果修改只留在这一台设备上,它主要是一笔售后和交付成本;如果解决方案经过验证后进入公共能力体系,再被100台、1万台机器人继承,它就开始变成研发资产。
而当越来越多改进能够被保存,新的瓶颈很快就会出现:AI可以越来越快地产生候选方案,真机实验能力却不可能同步无限扩张。此时最稀缺的资源,就从有没有方案转向了哪些方案值得真的拿机器试。
第三环:把最贵的真机时间留给最值得验证的方案
当候选方案越来越多,真机时间会迅速成为稀缺资源。设备数量有限、空间有限,一次实验还需要重新摆放物体、准备场景、排查故障,大量真实试错很容易拖住研发吞吐量。
World Model因此开始承担一个更实际的角色:先在虚拟环境里淘汰低价值候选,再把最贵的真机时间留给更值得验证的方案。对产业而言,关键并不是生成画面有多逼真,而是虚拟环境里判断更好的方案,到了真机上是不是仍然更好。
作为评估器的World Model——WALL-SS就专门检验了这件事[16]。研究团队对6项任务、5个策略checkpoint和20组匹配初始状态进行了600组仿真—真机对应测试,结果显示World Model保留了89%的真实策略排序,平均Spearman相关系数达到0.88[16]。
![]()
图片备注:WALL-SS通过动作条件下的长时序World Model预测未来状态,使大量策略候选可以先在虚拟环境中被模拟和比较,再决定哪些值得进入昂贵的真机验证。
图源:Maeve Zhang等,WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression,arXiv:2608.26239,2026年8月26日。
World Model还不能替代真机,但已经开始承担部分候选筛选器的功能。它的产业价值也因此可以被压缩成一个更具体的问题:同样100小时真机测试,谁能把更多时间花在真正值得验证的方案上?
当虚拟筛选、真机验证和能力继承逐渐连起来,问题还会再向前走一步。此前改变的主要是机器人怎样学习,接下来要改变的,是机器人能力本身怎样被研发出来。
第四环:AI开始进入制造能力的研发流程
在英伟达的研发框架ENPIRE中,其把coding agent直接接入真实机器人实验循环,由AI读取真机日志、分析失败、检索研究资料,再修改训练基础设施和算法代码,随后重新启动机器人实验[17]。
![]()
图片备注:ENPIRE把coding agent直接接入真实机器人研发闭环,让AI能够读取实验反馈、分析失败、修改算法与训练代码,再重新发起真机实验。
图源:NVIDIA GEAR Lab,ENPIRE: Agentic Robot Policy Self-Improvement in the Real World,Figure 2,2026年。
其论文展示了多台机器人并行执行rollout的框架,并在若干灵巧操作任务上报告coding agent自主把策略训练到99%成功率的结果[17]。这个数字背后,更值得关注的是AI修改的对象开始从动作策略上移到产生动作策略的研发流程。
机器人根据失败调整动作,是这一代能力在变强;AI参与失败归因、修改算法和组织下一轮实验,则意味着制造下一代能力的过程,也开始被机器接手。
把四个环节连起来看,具身RSI已经不再缺少零散零件:失败可以回流,改进可以保存,World Model可以减少无效真机试错,AI也已经进入部分机器人研发流程。
而仍未被真正证明的是,这些环节能不能跨任务、跨场景、长时间稳定地闭合,并让下一轮研发比上一轮更高效。
而决定这条闭环能不能被进一步放大的地方,并不只在实验室。它更可能出现在机器人真正大规模进入现实世界以后。
部署不是终点:真实世界如何反哺下一代能力?
机器人规模部署可能改变传统硬件的研发边界。
传统硬件的链条大体是:
研发→制造→销售→使用
产品交付,通常意味着这一轮研发基本结束。云端软件已经把链条改造成:
研发→上线→用户数据→更新
机器人有机会再往前推进一层:
研发→部署→真实行动→失败/接管/恢复→经验回流→学习与验证→下一版系统→再部署
如果这条链成立,机器人产品交付就不是其研发终点,而会反过来成为下一轮研发的入口。机器人每进入一家工厂、一个仓库、一户家庭,都会遇到研发团队事先无法穷举的新状态:光线不同、地面不同、物体摆放不同,人类行为也不同,实验室没有出现的问题会在部署规模扩大以后不断暴露出来。
因此,部署真正有价值的地方,并不只是产生更多数据,而是持续暴露这一代系统究竟不会什么。这也让机器人行业长期强调的数据飞轮,从数量问题开始转向经验的质量和转化效率。
数据价值,关键不在数据规模本身
真实部署数据最有价值的部分,往往不是丝滑的、成功的数据,而是那些暴露了能力边界的数据。9月发布的AGIBOT WORLD 2026 Theme 3,把真实执行经验进一步做成结构化数据集[18]。其首批11,430条真实轨迹里,不仅有1,024条成功自主执行,也包含1,369条失败执行,以及人工介入、环境扰动、错误状态和任务进度等信息[18]。
成功示范主要告诉系统任务应该怎样完成;而失败、接管和恢复则进一步暴露当前这一版会在哪里失效。正在此基础上,其随后发布的GE-Act 2.0继续把成功与失败交互、部署rollout等数据纳入训练体系,让过去可能直接被丢弃的失败轨迹也转化成为了学习信号[19]。
于是,“数据壁垒”的含义开始变化。几个月前,业内更容易比较的是多少小时数据、多少TB、多少台机器人;而当下,持续改进真正关心的则是,这些经验里有多少暴露了能力边界,又有多少最终改变了下一版系统。
只有后一个比例不断提高,数据才真正从库存变成能够产生复利的研发资产。也正因为如此,单纯比较部署数量仍然不够。
规模部署,不等于持续改进能力
部署规模只有和研发闭环结合,才会转化成学习速度。假设两家公司都部署了1万台机器人,第一家公司每天产生大量日志,但发现问题依赖人工,失败归因依赖人工,修改方案依赖工程师,最后验证还要排队等待研发团队。设备数量增加十倍,最先被放大的可能只是售后和运维压力。
第二家公司同样部署1万台,但系统能够自动找到异常轨迹、筛选高信息量失败,把它们转成训练样本和回归测试;候选方案先经过模拟器和World Model筛选,再进入真机验证,验证有效之后进入公共版本,最后重新部署。设备规模相同,长期研发价值可能完全不同。
真正拉开差距的,是中间这条链能不能连续运转:
问题暴露→原因识别→修改产生→实验验证→能力继承→再部署
任何一环断掉,规模部署都很难自动转化成技术壁垒;一旦闭合,部署规模才可能真正反哺研发。部署越多,暴露的问题越丰富;问题越丰富,下一版改进机会越多;下一版能力越强,又能够进入更多场景。
只有当真实部署中的问题能够稳定回流研发,部署规模才会真正转化为下一代能力的来源。
这也意味着,部署1万台机器人不再只是多卖出1万台硬件。如果每一台机器都在持续暴露真实问题,而这些问题能够进入公共研发循环,它们同时也可能成为1万个现实世界里的能力边界探针。
当然,这种闭环目前仍处于形成过程中,还不能把部署规模直接等同于学习速度——对产业和投资端而言,问题也因此要再往前走一步:不只是有没有数据飞轮,而是这条飞轮转得有多快,同时又需要付出多大的代价。
产业判断框架:有效改进效率
如果前面讨论的是研发闭环怎样形成,那么资本已经开始提前为这种可能性定价。5月,Recursive Superintelligence获得6.5亿美元早期融资,由GV与Greycroft共同领投,估值达到46.5亿美元[20]。国内,9月16日,成立仅数月的超衍智能完成天使轮及天使+轮,累计融资近4亿元人民币,核心方向同样指向自进化基础大模型[21]。
两个市场的资本动作指向的是同一种预期:如果AI能够参与提出方案、执行实验、读取结果、修改系统,再把有效改进带入下一轮,一家公司的研发能力就不再只由研究员数量和算力规模线性决定。
但融资金额只能说明资本愿意为这种可能性提前下注,并不能证明RSI已经成立。真正值得长期跟踪的,是这套研发循环有没有出现可持续、可比较、可量化的效率改善。
一套完整的持续改进系统,本质上重复的是:
问题发现 → 方案生成 → 实验执行 → 结果评价 → 系统修改 → 验证 → 再部署
本文将这条闭环把真实问题转化为经过验证的新能力的速度与资源效率,概括为有效改进效率。
换句话说,在质量、安全和任务难度大致可比的条件下,需要多少时间、人工、算力和真机实验,才能完成一次能够进入下一轮的有效改进。
为便于产业跟踪,可以进一步拆成以下四个维度:
![]()
部署经验转化效率:真实问题能否变成下一代能力?
部署经验转化效率衡量的是,真实世界暴露的问题有多少、以多快速度转化为下一版经过验证的能力。机器人公司通常会披露数据时长、设备数量和累计运行里程,但这些指标更多反映拥有多少数据,并不能直接回答这些数据产生了多少新能力。
可以重点观察四项:
高价值问题进入研发闭环的比例:真实部署中识别出的高价值失败、接管和异常轨迹,有多少最终进入训练集、回归测试集或Evaluator。
问题到能力的验证周期:从异常首次出现,到完成归因、候选方案生成、验证和新版本上线,需要多少时间,尤其是中位数和P90。
部署经验对版本升级的贡献率:每个主要版本新增能力中,有多少能够追溯到真实部署产生的数据和问题。
改进复用率:一个现场问题形成的修正,有多少能够跨设备、跨工位甚至跨任务复用。
这组指标回答的是:部署经验究竟只是在增加数据库存,还是在持续形成下一代能力。
实验资源效率:同样的真机与算力,能否验证更多有效改进?
实验资源效率衡量的是稀缺研发资源能够产出多少经过验证的有效改进。具身智能的稀缺资源不只有GPU,还包括真机、场地、运维人员和实验时间。因此,跑了多少小时真机本身意义有限,更重要的是这些实验最终产生了多少有效改进。
可以重点观察:
有效改进/100小时真机:每100小时真实机器人实验,最终有多少项修改通过验证并进入后续版本。
筛选后真机通过率:经过模拟器、World Model或离线Evaluator筛选后,真正拿到真机上的方案中,有多少被证明有效。
Sim-to-Real排序一致性:虚拟环境认为更好的方案,到真实世界是否仍然更好。
单位有效改进资源投入:每项有效改进对应多少GPU hours、robot hours和工程师hours。
同样的真机、算力和工程资源,谁能完成更多有效实验循环,谁的实验资源效率就更高。
AI研发杠杆:AI做了多少工作,更要看拿到了多少改进权
AI研发杠杆衡量的是单位人类研究力量能够调动多少有效研发产能。单纯统计AI写了多少代码并不足够,因为AI按照人类方案执行1000次实验,本质上仍然只是更便宜的执行层。
执行层自动化可以观察Agent工作时长/人类研究员工作时长、AI完成的研发任务占比、自动生成并最终合并的代码占比,以及每位研究员能够管理的Agent数量。
更深一层,要看AI参与改进决策的程度:AI发起实验的占比、AI自主决定实验优先级的占比、AI提出训练方法或基础设施修改的占比、Evaluator和回归测试自动化率,以及每次有效改进所需的人类介入次数。因此,AI研发杠杆必须与Evaluator质量、回滚能力和独立验证覆盖率同时观察。
当AI开始选择实验、判断需要获取什么经验、修改训练代码,并决定下一轮搜索方向,研发杠杆才真正从自动化执行进入自动化决策。对产业研究而言,更值得观察的也就不再只是AI做了多少工作,而是单位研究员能够调动多少有效研发产能。
这项指标必须和验证能力一起看。改进权越向AI转移,错误实验和reward hacking被自动放大的风险也越高,因此AI研发杠杆需要同时观察Evaluator质量、回滚能力和独立验证覆盖率。
单位有效改进成本:成本曲线能否跨代下降?
前三个维度最终都会落到一个更直接的问题:完成一次有效改进,到底需要多少资源?
单位有效改进成本 = 完成一项经过验证、能够进入下一版本的能力改进所需的总研发资源。
这里的资源至少包括算力成本、真机折旧与运维、数据和标注、人类研发工时,以及实验占用的时间。但一个时点的成本仍然不够,真正接近RSI的信号,是这个数字能否随着代际持续下降。
可以重点观察三项:
有效改进周期下降率:一轮有效改进的中位时间是否持续缩短。
单位资源成本下降率:每项有效改进对应的算力、真机和人工投入是否下降。
跨代效率提升幅度:第N代系统相对第N-1代,在可比预算下能够多产生多少有效改进。
如果这些指标只能短期改善,企业可能只是完成了一轮工程优化;如果它们在多个版本、多个任务和多个场景上持续改善,才真正开始出现改进能力本身也在提高的证据。
从资本视角看,这一点尤其关键。
普通软件公司的规模效应,来自新增用户的边际交付成本下降;平台公司的规模效应,来自网络扩大以后连接价值提高——而具身RSI如果成立,则可能出现另一种规模效应:部署规模扩大,不仅带来收入,还持续降低下一代能力的研发成本。
部署越多,暴露的真实问题越丰富;部署经验转化效率越高,问题转化为下一版能力的周期越短;实验资源效率越高,单位有效改进成本越低;研发Agent越强,又能进一步提高整个循环的吞吐量。基础模型、World Model、数据规模、真机数量和Agent数量,也只有进入这套循环,才从彼此孤立的技术资源,真正转化为一家公司的持续改进能力。
如果这些指标能够同时、跨代改善,文章开头那只“棘轮”才真正发生更深一层的变化:它不只是让每一代继续向前,而是让产生下一次有效改进所需的时间和成本也持续下降。
到了这一步,RSI就不再只是一个关于智能能否自我进化的抽象命题,而开始落到产业可以观察、资本可以跟踪的尺度上。
过去,我们聚焦于谁的机器人今天更强。
而接下来,更值得观察的是另一种能力:
谁能把机器人在真实世界暴露的问题,更快、更低成本地转化为下一代经过验证的新能力。
本文讨论的具身智能RSI仍处于早期阶段,现有证据主要来自论文、企业披露和有限场景实验,尚不足以证明相关能力能够跨任务、跨场景、跨代稳定成立;同时,真实部署中的泛化、验证、安全、成本和监管等因素仍可能影响技术演进与商业化节奏。本文基于公开信息进行研究与判断,相关结论可能随技术进展而变化,不构成针对任何具体标的的投资建议。
参考资料:
[1] Tomasello M. The human adaptation for culture[J]. Annual Review of Anthropology, 1999, 28: 509-529.
[2] AGIBOT. AGIBOT’s 15,000th robot rolls off the production line, marking a new milestone in embodied AI deployment[EB/OL]. (2026-06-28)[2026-09-22].
[3] XPENG. IRON, the first general-purpose humanoid robot, rolls off XPENG’s new production line[EB/OL]. (2026-09-08)[2026-09-22].
[4] 2026世界机器人大会. 2026世界机器人大会主论坛大咖观点(二)[EB/OL]. (2026-08-20)[2026-09-22].
[5] Duan Y, Liu Y, Tang Z, et al. The last AI built by humans: toward genuine recursive self-improvement[EB/OL]. (2026-09-10)[2026-09-22].
[6] Good I J. Speculations concerning the first ultraintelligent machine[M]//Alt F L, Rubinoff M, eds. Advances in Computers. Vol. 6. New York: Academic Press, 1965: 31-88. DOI: 10.1016/S0065-2458(08)60418-0.
[7] Anthropic. Measurements for understanding the pace of AI development inside frontier labs[EB/OL]. (2026-09-17)[2026-09-22].
[8] Zheng T, Wu X, Zhang Z, et al. Dream-RSI: recursive self-improvement through evolving worlds[EB/OL]. (2026-09-14)[2026-09-22].
[9] Zhang J, Hu S, Lu C, et al. Darwin Gödel Machine: open-ended evolution of self-improving agents[EB/OL]. (2025-05-29)[2026-09-22].
[10] Weco Team. AIDE²: the first evidence of recursive self-improvement[EB/OL]. (2026-07-14)[2026-09-22].
[11] Von Arx S, Chan L, Barnes B. Recent frontier models are reward hacking[EB/OL]. (2025-06-05)[2026-09-22].
[12] OpenAI. Research acceleration: the view inside OpenAI[EB/OL]. (2026-09-06)[2026-09-22].
[13] Patel D. Noam Brown – agent swarms, alignment, & recursive self-improvement[EB/OL]. (2026-09-17)[2026-09-22].
[14] Giridhar V, Khandelwal A, Collins J A, et al. Beyond imitation: self-improving robot policies via off-policy Q-planning[EB/OL]. (2026-08-21)[2026-09-22].
[15] Lu R, Wu Y, Kou E, et al. ASPIRE: agentic skills discovery for robotics[EB/OL]. (2026-06-30)[2026-09-22].
[16] Zhang M, Sun R, Wang X, et al. WALL-SS: scaling long-horizon world models via next-scale autoregression[EB/OL]. (2026-08-26)[2026-09-22].
[17] Xiao W, Xie J, Zhang T, et al. ENPIRE: agentic robot policy self-improvement in the real world[EB/OL]. (2026-06-18)[2026-09-22].
[18] AGIBOT. AGIBOT releases AGIBOT WORLD 2026 Theme 3 for real-world robot reinforcement learning[EB/OL]. (2026-09-01)[2026-09-22].
[19] AGIBOT. AGIBOT releases GE-Act 2.0, providing the first systematic validation of a scaling path for native world-action models[EB/OL]. (2026-09-10)[2026-09-22].
[20] GV. Recursive Superintelligence: why self-improving AI is the next frontier[EB/OL]. (2026-05-13)[2026-09-22].
[21] Apex Intelligence. Apex Intelligence raises nearly US$50 million in angel funding to build self-evolving foundation models[EB/OL]. (2026-09-16)[2026-09-22].







快报
根据《网络安全法》实名制要求,请绑定手机号后发表评论