世界模型是2026年AI领域最热门的赛道之一。热潮之下,围绕世界模型评测标准、技术路线与落地路径,行业正经历一场从“生成像不像”到“执行可靠不可靠”的深层讨论——这关乎物理AI究竟该以何种方式走出屏幕、走进现实。
“数字世界模型失误仅影响图文生成,而物理场景下智能体预判偏差将产生不可逆真实损失。”在近日举行的世界模型“六小龙”巅峰论坛上,大晓机器人董事长王晓刚直击具身智能行业痛点。他提出,要遵循具身世界模型第一性原理,依托多模态高密度信息萃取、控制充分状态锚定,在复杂不确定环境中最大限度降低机器人行动试错成本,加速物理AI的“开悟”时刻到来。
该公司首席科学家、澳大利亚科学院院士陶大程举例道,机器人端着水杯,画面很稳,但动作不平稳——模型不理解水可能会泼溅出来。“这是画面满分、物理零分。”他表示,做具身世界模型不是为了复刻像素,而是为了控制相关的行动。像素复刻是给人看的,物理推演是给机器人用的,这是两件事,不太一样。
当日,大晓机器人发布首个端侧驱动本体的世界模型开悟 3.1(Kairos 3.1),打通理解、生成、预测技术壁垒,构建 “理解-推演-执行-反思”全链路自进化智能闭环,具身世界模型正从单一能力突破迈向产业落地的完整闭环。
在圆桌讨论期间,陶大程与蚂蚁灵波首席科学家沈宇军、极佳视界首席科学家朱政、无界动力联合创始人兼CTO夏中谱、智元机器人AI算法总监任广辉、自变量机器人联合创始人兼CTO王昊形成了同一个判断:世界模型不能再用“视频生成”的标尺来量。过去这一年,行业最热闹的是画面逼不逼真、时长够不够长、一致性好不好。但对机器人来说,“推开这扇门需要多大的力”“拿起杯子会不会碰到旁边的人”“动作执行下去会不会带来不好的影响”,这些才是更重要的问题。
几位嘉宾的技术路线各不相同——有人做动作世界模型,有人做隐空间表征,有人做端到端世界统一模型——但大家的共识是:下一代世界模型需要从“生成得像不像”走向“执行得可靠不可靠”。
王昊认为,世界模型的核心在于对世界的真正理解,而评判这一理解的关键指标有三:第一是反事实推理能力,即模型能否基于当前状态与给定动作预测未来状态,而非简单外推;第二是恒常性表示能力,类比人类大脑即使物体被移动或遮挡仍能识别其为同一物体,考验模型能否提取关于世界的稳定表征;第三是推理时效性,他强调不必追求长程预测,快速获得反馈并即时响应对于具身智能至关重要。
陶大程提出,当前世界模型常跑在云端,但机器人在产线上决策仅有几十到一百多毫秒,无法依赖远程网络。因此,大脑无需装下整个世界,任务导向的紧凑世界模型若能跑在端侧直驱本体,其产业价值可能远超云端大脑。他坦言,最难的不是让模型变聪明,而是让聪明变得便宜、高效、可靠——“产业不会为聪明买单,只会为稳定的聪明买单。”
在另一场主题为“从虚拟到现实:世界模型如何驱动具身智能?”的圆桌论坛中,亮源新创创始人兼CEO姜旭提出,过去几年,大模型的发展本质上是一个不断模仿人、最终超越人的过程。而人在物理世界中完成各种动作时,并不会像视频生成模型“预测下一帧”那样不断预测世界的下一个状态,而是在充分观察环境、获得视觉信息之后,自然而然地做出动作。
基于此,姜旭认为,状态应该被感知,动作应该被预测,世界模型真正需要突破的是建立大规模的“状态—动作”映射。“希望通过架构创新和数据创新,更好地统一状态理解和动作预测两项能力。”姜旭预测,具身智能最先发生能力跃迁的领域,一定是互联网已经积累了大量数据的领域。







快报
根据《网络安全法》实名制要求,请绑定手机号后发表评论