在9月26日举行的第五届全球数字贸易博览会上,杭州美梦空间科技有限公司(下称“美梦空间”)发布了两项具身智能领域成果:物理-世界动作模型Physical-WAM,以及机器人物理漂移评测基准RoboTwin-Phys。两项成果均已开源。
![]()
VLA的物理短板:看得懂指令,摸不准物理
当前,视觉-语言-动作(VLA)模型是具身智能的主流技术路线,但其物理鲁棒性正受到学界关注。北京大学与BeingBeyond联合发布的BeTTER基准(ECCV 2026)显示,VLA模型在标准静态测试中的表现尚可,但在空间布局偏移、时序外推等干预条件下,任务成功率显著下降。斯坦福大学的相关研究则指出,在接触密集型任务中,VLA存在“精度失效”与“力失效”两类相互独立的失效模式——模型可以识别目标物体并规划动作,却难以感知物体质量、摩擦系数、重心变化等物理属性。
数据层面的约束同样明显。文本、图像领域的训练样本可达数十亿级,而机器人真实物理交互数据因采集周期长、硬件损耗成本高、跨本体迁移存在壁垒,目前仅维持在百万量级,两者相差多个数量级。
Physical-WAM:在感知与动作之间插入“物理Token”
针对上述问题,美梦空间提出Physical-WAM。与传统世界模型采用像素或隐空间向量作为中间表征不同,该模型在感知输入与动作输出之间引入一层“物理Token”表征,用以编码摩擦、重量、重心、接触状态等不可直接观测的物理量。
据公司介绍,Physical-WAM由三个模块构成:PhysLens从多模态感知信号中提取物理信息,输出物理Token;PhysDream基于当前物理表征与环境状态,推演候选动作可能导致的未来物理状态,并对打滑、脱手等风险给出不确定性评估;PhysAct将物理属性与未来状态预测引入动作生成,在环境发生物理漂移时调整执行策略。三者构成“感知—预测—生成—修正”的闭环。以抓握纸杯为例:PhysLens识别杯壁的低刚度特性,PhysDream预测注水后负载增加可能导致的形变或滑脱,PhysAct据此调整抓握力度与接触位置,并在执行过程中持续修正。
公司称,Physical-WAM基于可观测数据与深层物理数据训练,可在真实任务中实时觉察物理变化并预判动作后果。
RoboTwin-Phys:把物理扰动变成可控、可复现的变量
技术路线的竞争最终需要评测来检验。现有基准多测量“任务完成度”——即在固定摩擦、固定质量条件下模型能否完成任务,对物理参数扰动的鲁棒性覆盖不足。
美梦空间同步发布的RoboTwin-Phys,是业内首个以物理因素扰动为核心评测对象的机器人操作基准。该基准在RoboTwin框架基础上新增13类真实场景常见物理扰动,覆盖物体属性、接触属性、阻尼、任务环境、相机配置五个维度,支持单因素与多因素组合扰动。评测分三层递进:物理属性推断的准确性、扰动下的任务成功率,以及模型性能上界。据介绍,基准提供物理真值标注(物理参数、接触力日志、运动学数据、失败时间线),并采用固定种子配对评估,即让不同模型面对相同扰动实例,以降低随机性对结果的影响。由此可区分两类失败:物理状态识别错误,与识别正确但动作策略未能适配。项目代码、数据集与排行榜均已开放,支持第三方复现。
获索辰科技独家种子轮投资,落地效果仍待检验
美梦空间由北京大学信息技术高等研究院高文院士领衔的AVS先进视觉系统研究中心孵化,研发方向为世界模型,核心团队来自具身智能、视频编解码、空间计算等领域。2026年8月,物理AI企业索辰科技(688507.SH)完成对美梦空间的独家种子轮战略投资,双方在数据、算力、物理AI等层面展开协同。
不过,“世界模型”目前尚无统一技术定义,视频生成、状态预测、基于模型的强化学习等研究路径差异较大,美梦空间提出的路线是其中一种探索。公司方面也承认,Physical-WAM仍面临若干未解问题:物理Token对表面粗糙度各向异性、材料非线性弹性等细粒度属性的表征上限;同一物理参数在不同末端执行器(如二指夹爪与灵巧手)之间的迁移效率;以及仿真引擎保真度对PhysDream推演精度的制约——对织物大变形、颗粒材料流动等仿真难以建模的物理效应,闭环系统的鲁棒性边界尚不明确。
美梦空间CEO李明昊表示,下一步将按“视觉先行,力触声递进”的路线迭代多模态物理表征模型,扩充物理交互数据集,优化推理延迟与多本体适配。他表示,将以开源方式推动行业共建。
总体来看,美梦空间试图从“物理感知”这一细分角度切入世界模型的竞争,其评测基准的开放性或有助于行业建立统一的检验标准。但模型实际性能与产业落地效果,仍有待更多公开数据和第三方评测验证。






快报
根据《网络安全法》实名制要求,请绑定手机号后发表评论