机器人把一堆积木叠成塔,或者从抽屉里取出螺丝刀递给你时,它面对的远不止拿起来放过去这个几何问题。离散的任务决策与连续的物理约束被死死耦合在一起:先拿哪个模块,手臂关节转到多少度,抓爪用多大力才不会滑落,路径怎么绕过障碍物。这把学术界折腾了二十多年的老大难,有一个正式名字:任务与运动联合规划,TAMP。
过去十年,一类叫广义TAMP的方法试图通过跨问题实例学习共性模式来加速新问题的求解。思路是对的,但代价极高——每次都要手工设计符号化谓词、手动编写操作符、精调采样器参数。规划器还没开始运行,研究者已经被工程代码拖死。
2026年9月24日,普林斯顿大学机器人规划与学习实验室(PRPL)的一篇论文给出了一种近乎反常识的回答:与其花数月手写TAMP求解器,不如直接给coding agent一个任务描述和一个仿真器,让它自己去搞懂物理。
结果显示:三个通用coding agent全面碾压了人类专家精心调试多年的专用规划器。
一个暴力而优雅的实验设计
论文一作Matteo Merler来自意大利布鲁诺·凯斯勒基金会(FBK),通讯作者Tom Silver是普林斯顿大学ECE助理教授、PRPL实验室负责人,团队还包括来自卡内基梅隆大学和剑桥大学的研究者。他们的实验方案极简到了近乎粗暴的程度。
给定一个任务描述和一个可交互的仿真器,coding agent在固定预算内自主决定如何与环境互动。它可以写代码探测仿真器的物理响应,可以根据结果重写自己的策略,可以反复试错——唯一限制就是预算。最终产出一个冻结的程序,在全新的测试实例上做零样本推理,且推理阶段不再有任何LLM介入。
一句话:让AI像人类程序员一样,先用仿真器做实验,然后写一个能用的程序。
研究者选了两种主流coding agent——Claude Code(基于Claude Opus 5)和Codex(基于GPT-5.6 Sol和GPT-6 Astra),部署在28个仿真环境中,涵盖二维和三维的几何与动力学任务。环境来自KinDER基准(25个环境,分为运动学2D、动力学2D、运动学3D、动力学3D四个家族)和PDDLStream基准。物体数量超过了原始基准的上限,以测试泛化极限。
整个实验的规模:7种程序合成方法、每个环境5次运行、每次运行生成一个程序、每个程序在100个未见实例上评估——总计980个生成程序,98,000次评估回合。
结果让传统TAMP研究者无法忽视。
反超:通用coding agent击败专用求解器
在16个拥有手工规划器基线(hand-engineered planner)的环境中,三种agent配置全部胜出。
Claude Code(Opus 5)平均成功率82%,是手工规划器47%的1.74倍。Codex(GPT-6 Astra)平均成功率高达95%。Codex(GPT-5.6 Sol)平均成功率56%——即便最弱的版本也高于规划器。
相比另两种基线——零样本一次性生成(one-shot generation)和基于LLM的广义规划方法LLMGenPlan——coding agent在全部28个环境中的平均成功率也全面领先。
更有说服力的是缩放行为。当环境中的物体数量增长时,手工规划器的求解时间急剧上升,成功率持续下滑;而coding agent生成的程序,成功率和计算时间双双保持稳定,平均每个实例的算力消耗低了一个数量级。
一个没有接受过任何TAMP专业训练、没有人类提供符号化谓词和采样器的通用coding agent,仅凭任务描述加仿真器访问权两样东西,就完成了对专用系统的全面反超。
coding agent在仿真器里自学物理
比数字更重要的是过程。论文提供的agent日志揭示了coding agent在预算内做了三件传统TAMP系统做不到的事。
第一,校准物理模型。agent反复在仿真器中执行动作,观察物体的响应,自行推断摩擦系数、碰撞响应、滑动特性。它不是被编程去理解这些参数的,而是通过做实验猜测出来的。
第二,测试边界条件。agent刻意把物体推到极限位置,观察什么情况下会失败。这不是传统TAMP求解器的典型行为——传统方法会尽量避开失败,而agent主动寻找失败边界,以获得更鲁棒的模型。
第三,迭代策略优化。基于失败案例自动重写代码逻辑。如果某个动作序列导致失败,agent会修改程序中的条件分支、调整参数值或者完全换一种求解策略。
这种边做边学的能力恰恰是TAMP领域过去十几年最难攻克的痛点。传统TAMP的求解流程是先建模再规划再执行——建模阶段错了,后面全错。而coding agent把建模和规划融为了同一个迭代过程。
还有一个关键设计决策值得强调:测试阶段完全不依赖LLM。经过预算内的探索和编程后,最终产物是一个纯代码程序,不含任何模型调用。这意味着最终的程序轻量、可部署、推理延迟极低——这正是工业机器人场景最需要的特性。
反转:LLM在TAMP中的角色被重新定义
LLM在TAMP中的应用并非新方向。LLM-GROP、AutoTAMP等方法都已尝试用LLM指导TAMP求解。但这些方法的核心思路是把LLM当作规划器的一部分——每次推理都要调用大模型来生成或修正动作序列,延迟高、成本大,LLM在几何推理上的表现也不稳定。
2026年,Mendez-Mendez等人在一篇系统研究中明确指出:当涉及几何和物理决策时,即使把几何信息直接写进prompt,LLM在TAMP中的表现仍然很差。
这篇新论文的突破在于重新定义了LLM在TAMP中扮演什么角色这一根本问题。LLM不再是实时规划器,而是代码编译器:它利用语言理解和代码生成能力,在探索阶段快速编写和调试一段面向特定物理环境的策略程序。程序一旦写好,LLM的作用就结束了——运行时全靠代码本身。
这种LLM开发、代码执行的分层架构,巧妙地绕过了LLM在实时物理推理上的短板,同时最大化地利用了它在理解任务和编写逻辑上的优势。
结论边缘的三个问号
这篇文章的结论写在严格受限条件下,有几个问号需要画出来。
第一个问号:所有实验都在仿真中进行,没有真实的机器人实验。仿真器的物理模型本质上是确定性的,而真实世界的摩擦力不对称、关节回差、传感器噪声等非理想因素可能让agent学到的策略失效。从仿真到真实的迁移,是机器人领域最难翻越的山之一。
第二个问号:28个环境虽然有广泛的物理任务覆盖,但都停留在桌面操作范畴——堆积木、拾取放置、推拉门闩。更复杂的场景——双手机器人协作、柔性物体操作、动态环境中的在线规划——尚未被验证。
第三个问号:虽然推理阶段轻量高效,但程序合成阶段的开销不可忽视。每个环境需要在固定预算内进行多轮交互和代码调试。对于全新的任务域,这个合成成本可能仍然偏高。论文设置的固定预算是否对所有环境都足够,也是开放问题。
论文作者没有回避这些局限。他们在文中明确将coding agent定位为TAMP方法的强基线——它不一定能解决所有问题,但任何新提出的TAMP方法都应该与之对比,因为后者几乎不需要领域工程。
从人工设计求解器到AI自动发现求解器
把视野拉大,这篇论文的潜台词比实验结果本身更有分量。
2025年到2026年,机器人行业经历了一轮前所未有的AI渗透潮。英伟达推出GR00T基础模型,Google DeepMind演进RT系列,OpenAI投资Figure AI,斯坦福Mobile ALOHA掀起开源热潮。所有人都在追问同一个问题:机器人能不能像大模型一样,通过大量数据加通用架构实现智能涌现?
TAMP长期是这条路上最难啃的骨头。它不像视觉或语言可以用数据暴力出奇迹,因为操纵问题同时需要离散的逻辑推理和连续的几何计算——两层之间的接口需要手工设计,而设计的好坏直接决定系统的成败。
这篇论文给出了一个简单但深刻的回答:如果万能的通用算法不存在,那就让能写代码的AI为每个特定环境自动生成专用算法。这不只是LLM加机器人的故事,而是范式转移——从人工设计求解器,到AI自动发现求解器。
Tom Silver的PRPL实验室以及合作方NVIDIA的参与并非偶然。当coding agent可以为每个新的物理环境自动生成高效规划程序时,软件定义机器人就不再只是一句口号。你只需要给agent一个仿真器和一张任务清单,剩下的交给代码。
三个通用agent,98,000次测试,击败手工规划器1.74倍。这也许只是通往通用机器人智能路上的一小步。但如果这一小步像LLM在编程任务上的进步一样每年加速重复,那机器人领域的Scaling Law就不会太远了。
机器人不怕物理世界复杂,怕的是你还在手工调参。






快报