对话昆仑万维方汉:世界模型“算账逻辑”之下,异构数据才是具身智能的解药

AGI
无论是文本大模型的走向收敛,还是世界模型对DiT架构的统一,技术底层的逻辑正在变得透明。真正的壁垒,已经转移到了企业对异构数据的清洗能力、算法的迭代速度,以及最粗暴的资金与硬件筹措能力上。

昆仑万维董事长兼CEO方汉

昆仑万维董事长兼CEO方汉

如果说过去两年人工智能行业的绝对主角是大语言模型(LLM),那么今年无疑是各类形态各异的具身智能机器人与空间智能设备。

在这个WAIC 2026展区中,被层层围观、讨论最密集的赛道,从技术极客到产业资本,所有人抛出一个共同的疑问:具身智能的“ChatGPT时刻”究竟何时到来?

在这场关于下一代计算范式和人工智能物理形态的竞速中,底层路线的分歧与收敛正在以前所未有的速度上演。

“2026年为‘世界模型元年’,标志着AI从内容生成走向对物理世界的理解与交互的关键转折。”昆仑万维董事长兼CEO方汉在“世界模型与多模态范式跃迁”专场论坛上断言。

论坛结束后,我们与方汉进行了一场对话。从世界模型的端到端演化、Scaling Law在视频与物理世界的延续,到一笔高达数百亿的“数据经济账”,他描绘了一幅相对清晰的产业路线图。

当我们追问行业真正的分化节点何时到来时,方汉的回归了本质的技术信条:数据量级。百万小时、千万小时、上亿小时,这是一个阶级分明的坐标系。

无论是文本大模型的走向收敛,还是世界模型对DiT架构的统一,技术底层的逻辑正在变得透明。真正的壁垒,已经转移到了企业对异构数据的清洗能力、算法的迭代速度,以及最粗暴的资金与硬件筹措能力上。

2026年,站在世界模型元年的风口上,具身智能已经完成了从技术黑盒到工程流水线 的思想转变。而这场重塑物理世界交互法则的战役,才刚刚打响。

以下是我们这次对话五个核心观点。

一、路线大一统:端到端世界模型与“千万小时”定律

当前具身智能正处于起步探索阶段,百花齐放,却在某种程度上像是在迷雾中穿行,方汉认为,可以对标的一个坐标系——自动驾驶。

“我觉得可以用自动驾驶来做一个参照。大家都知道自动驾驶经过多种技术路线的角逐,最后全部收敛到了端到端的FSD系统上。”方汉表示。

他强调,具身智能和世界模型最终也必定会走向端到端的架构,因为只有这种架构才能实现真正意义上的“Scaling Up(规模扩展)”。

在此之前,多流派的探索在解决长尾场景和泛化性时显得捉襟见肘。而端到端模型的破局,关键在于跨越数据量的“奇点时刻”。方总以视频生成模型的发展作为类比:视频模型沉寂多年,直到训练规模达到“20亿个15秒的切片”时,才终于迎来了质的飞跃。

目前的进度条走到哪里了?据方汉透露,各大头部厂商目前普遍处于10万到20万小时的阶段。这意味着,行业正处于冲刺百万小时、千万小时关口的竞速期。他预测,今年底或许有厂商能达到百万小时级别,而千万小时的拐点极有可能在明年底由头部厂商率先突破。

二、异构数据破局:一场从500亿到1亿元的“算账革命”

如果Scaling Law是毋庸置疑的真理,那么横亘在所有企业面前的唯一挑战就是——算账。在千万小时甚至亿级小时的数据需求面前,具身智能的数据采集模式,在商业逻辑上似乎完全失效。

方汉为我们算了一笔略显残酷的账:在早期,具身智能的数据主要分为UMI数据和真机数据。这种数据的生产成本极高。

以最基础的数据采集设备为例,原本单副采集手套的成本就高达十几万元,直到今年才勉强降至一万多元。在此设备基础上,单位小时的UMI和真机数据采集成本最低也需要500元人民币,高的甚至达到一两千元。

“我们可以算一下,如果要生产1000万小时的真机数据,乘以500元的单价,至少需要50亿元。如果是1亿小时的数据,那就是500亿元。这个成本是谁都架不住的。”方汉坦言。

打破这一资本黑洞的终极武器,被确认为异构数据(Heterogeneous Data)。

“异构数据的出现,比如用手机、甚至胸挂摄像头拍摄的人手操作数据,使得采购成本大幅下降。”方汉表示,目前异构数据的采集成本已降至每小时50元左右,他更进一步预测,从今年到明年,通过视频采集的异构数据成本有望下探至每小时10元。

“当成本降到10元一小时,1000万小时的数据只需1亿元人民币。这个成本大家是可以负担的。所以大家一定会用异构数据来Scaling我们的具身模型或世界模型,这是最现实的路径。”方汉说。

除了绝对的成本优势,异构数据在生态多样性与环境复杂度的覆盖上,远远超越了昂贵的真机数据。比如说,黎曼动力机器人在1.0模型的训练实践中,团队发现大量异构数据的引入不仅提升了泛化能力,甚至在“叠衣服”这种传统认为只需UMI数据的具体操作上,也带来了极大提升。

三、供应链与人口结构:中国不可复制的具身智能优势

在具身智能与世界模型的赛道上,方汉指认为,宏观战略的天平正在向中国倾斜。这一优势,建立在中国不可复制的工业门类全集与庞大的人口基数之上。

具身数据的本质是物理世界的操作记录。这意味着,任何数据的采集都重度依赖于硬件设备与真实场景的结合。“中国是所有数据采集设备的硬件主产地,跟中国厂商去卷硬件成本,世界上没有谁能卷得过。”方汉直言。

正如汽车雷达行业曾经发生过的成本雪崩一样,具身视频采集设备也正在经历类似历程。大量的消费电子大厂正在入局,开发低成本的带运动加速度传感器的双目摄像头,甚至是隐蔽性更好、更便携的采集穿戴设备。

更深层次的护城河在于“场景产能”。

“中国有全世界最全的工业门类,代表着我们的工业产品最全。同时,我们的服务业非常发达,这就意味着我们能构造出极其丰富的各种操作数据。”方汉认为,数据最大的产能地一定是不仅具有硬件制造能力,还具有深度场景下潜能力的中国。

四、基础模型护城河与“拿着钉子找锤子”的应用陷阱

在大模型商业化的探讨中,行业内常有一种声音认为:底层模型格局已定,接下来重心将从模型层全面转向应用层与垂直领域。对此,方汉表达了反对态度。

“我不太认同这个看法。做应用层也是非常危险的,因为你不知道你的应用能力何时会被大模型的发展所包含并内化掉。”

他以近期热门的Skills(技能树)为例,指出最新一批文本大模型正是利用了各行各业专家编写的Skills进行训练,导致大模型厂商能够轻易获得这些行业最有价值的流程和能力。

对于当前大量创业者试图在垂直行业落地的现状,方汉也指出了产品定义上的逻辑谬误——“拿着锤子找钉子”。很多创业者认为自己的模型能力很强,于是到处寻找行业去赋能,这种做法充满风险。

正确的路径应当是倒推:“你需要更熟悉一个行业最真实的需求,然后从需求倒过来寻找,什么样的模型或AI应用能够满足这个需求。”

五、泛娱乐的降维打击:从短剧平权到游戏模型的算力困局

方汉透露了一个商业现实:“今年消耗量最大的API一定是视频生成。国内某大厂的视频生成收入,已经占了其总收入的一半以上。”

这种爆发背后的逻辑,是门槛的降低带来了创作者规模的指数级扩张。“视频模型的爆款也许没有当年看电视剧《渴望》万人空巷的高度,但它满足了海量的长尾需求,视频创作者的规模绝对不会低于网文作者。 ”

然而,在影视和游戏这两个被寄予厚望的终极娱乐形态上,AI的渗透步伐却因商业规律和物理法则而产生了分化。

对于AI电影,方汉认为技术早已不是障碍,爆款AI院线电影和长剧的出现只是时间问题。但对于原生AI游戏,他则表示,受制于巨大的推理成本鸿沟(游戏世界模型的推理速度必须比传统3D引擎更快),真正的游戏世界模型落地,至少还需要3到5年的时间。(本文首发于钛媒体APP,作者|李程程,编辑|杨林)

本文系作者 LCC_Beta版 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里

敬原创,有钛度,得赞赏

赞赏支持
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

登录后输入评论内容

扫描下载App