在计算机视觉领域,有一条不成文的规则:一个任务,一个模型。想要做深度估计?用 Depth Anything。想做图像分割?上 Segment Anything。想做姿态估计?找专门的关键点检测器。每增加一个任务,就多一个独立架构、一套独立训练流程、一堆独立标注的数据集。
谷歌DeepMind的一篇新论文,正在试图终结这种“各扫门前雪”的格局。
2026年7月,在计算机视觉顶会 ECCV 2026 上,DeepMind 联合 MIT、牛津大学、多伦多大学、伦敦大学学院的研究团队发布了一个名为 GenCeption 的框架。它的核心主张简单到令人不安。一个预训练的视频生成模型,不需要为每个任务重新设计架构,就能同时做好深度估计、表面法线预测、相机姿态估计、指代分割和 3D 关键点预测。而且,在多项基准测试中,它做得不比任何一个专用模型差。
更关键的是,它用的训练数据,只有专用模型的七分之一到五百分之一。
现象层:当“生成”成为“理解”的前提
如果说2025年属于 Segment Anything 和 Depth Anything 这些“专用基础模型”的崛起,那2026年的 ECCV,很可能正在定义下一个范式:生成即理解。
GenCeption 的名字本身就是一个隐喻,它是“Generation”(生成)和“Perception”(感知)的合成词。这并非语言游戏。DeepMind 团队的核心判断是:大型文本到视频模型在训练过程中,已经学会了场景空间结构、物体运动规律以及语言与视觉之间的关联。这些能力,恰好是视觉感知任务所需要的全部前提。
换句话说,一个会“画”视频的模型,天然就懂得“看”视频。
这种思路在直觉上说得通,但此前几乎没有人在工程上真正验证过。GenCeption 做到了。它基于阿里巴巴开源的通义万相 Wan2.1 视频生成模型,通过简化架构,将原本需要多步采样的扩散生成过程,压缩为一次前向传播的感知预测。输入一段视频和一段文本指令,GenCeption 在同一套参数下,输出深度图、法线图、分割掩码、3D 关键点,甚至可以从单段视频中重建出 4D 点云。
研究团队在论文中展示了覆盖稠密预测(深度、法线、相机姿态)和稀疏预测(指代分割、3D 关键点)的多个视觉任务的评测结果。在几乎所有任务中,GenCeption 的通用版本与专门为每个任务单独训练的版本性能相当,且均达到或超越了当前最先进的专用模型,包括 DepthAnything3、D4RT、VGGT-Ω、SAM3、Sapiens 等。
但最令人惊讶的不是“能不能做”,而是“需要多少数据”。
技术路线:从“学会生成”到“学会感知”
GenCeption 的技术路线,可以用一句话概括:视频生成模型不是一个工具,而是一个学习者。
传统的视觉专用模型,多采用自监督预训练(如 V-JEPA、VideoMAE V2)或大规模人工标注来学习表示。GenCeption 走了一条截然不同的路。它直接拿一个已经训练好的视频生成扩散模型,做二次用途改造。
具体来说,GenCeption 基于阿里通义万相 Wan2.1 的视频生成主干,保留了其 Transformer 架构,但将原本需要多步降噪采样的生成过程,改造成单步前向传播的感知推理。对于稠密预测任务,模型直接在 RGB 潜空间输出预测结果。对于稀疏预测任务,则引入可学习的 Token 作为额外输入,让主干网络在推理时一并处理。
这种方法的关键优势在于:视频生成模型在预训练阶段,已经通过互联网规模的视频数据,学习了丰富的时空先验和视觉语言对齐。后续的微调本质上是一种提示,告诉模型在哪些维度上输出信息。这就好比一个已经读过万卷书的人,只需要一道简短的题目就能展示自己的理解,而不是从头学起。
GenCeption 的论文在标注数据效率方面,给出了一个令人瞠目的数字。在匹配的微调数据量下,视频生成主干的表现优于 V-JEPA 和 VideoMAE V2 等替代预训练范式,并且展现出初步的规模缩放特性:更大的模型和更多的数据,表现持续提升。与 D4RT 和 VGGT-Ω 等领先模型相比,在达到同等性能水平的条件下,GenCeption 所需的训练数据量仅为它们的 7 倍到 500 分之一。
涌现行为:合成数据训练出来的“通用视觉理解者”
GenCeption 的第二个亮点,出现在论文的“涌现行为”章节。
研究团队在合成数据上训练了模型。只有单人、合成背景、受控动作。按照传统认知,这种模型切换到真实场景时,域迁移会带来严重的性能下降。但 GenCeption 的表现恰恰相反。
它零样本迁移到了真实世界视频。它能够处理训练数据中从未出现过的多人场景。它甚至能泛化到训练时从未见过的物体类别,包括动物、人形机器人,以及火箭等完全陌生的物体。
论文将这些现象归因于视频生成预训练中编码的“领域不变表征”。在互联网视频上,模型见过各种光照、纹理、视角和运动模式。当这些先验知识足够丰富时,合成数据微调只是在“对焦”。模型已经知道世界长什么样,合成数据只是告诉它输出格式。
对于机器人领域的研究者来说,这一点尤其值得关注。长期以来,sim-to-real 迁移是机器人感知的核心难题,通常需要复杂的域随机化工程来弥合。GenCeption 的涌现行为暗示了一条新路径:一个足够强大的生成式主干,天然就能完成从仿真到现实的迁移。
格局变化:统一模型会取代专用模型吗?
GenCeption 的出现,不可避免地引发了一个问题:如果视频生成模型可以同时做好所有任务,那专用模型还有存在的必要吗?
答案是:不会立刻取代,但格局正在松动。
在 GenCeption 的评测中,通用配置与专用配置的性能相当,这意味着“统一”没有带来明显的代价。但研究团队也坦承,联合训练多个任务可能影响部分复杂任务的性能。也就是说,在某些极端精度要求的场景下,专用模型仍然有优势。
此外,推理速度是另一个现实约束。GenCeption 处理 81 帧视频需要 6 到 10 秒。对于离线分析任务来说,这完全可以接受。但对于需要实时响应的应用,比如自动驾驶、机器人实时控制,这个速度还远远不够。
不过,需要指出的是,GenCeption 的推理瓶颈并非来自“统一架构”本身,而是来自其底层的扩散模型。随着自回归视频生成模型等新型架构的成熟,推理速度有望大幅提升。
从更宏观的视角看,GenCeption 代表的是“架构收敛”趋势。在自然语言处理领域,GPT 等通用模型已经证明了一个架构可以处理翻译、摘要、对话、代码生成等多种任务。计算机视觉正在经历同样的过程,从“每个任务一个模型”走向“一个模型做所有事”。
信号与展望
GenCeption 的发布,不是一个产品的发布,而是一个信号的释放。
它用数据和实验证明了一件事:视频生成模型不仅仅是一个“内容生产工具”,而是一个正在成熟的“视觉理解引擎”。当行业对视频生成商业化的路径感到迷茫时,DeepMind 从另一个角度找到了视频生成模型的价值,不是用来造视频,而是用来读世界。
这个信号对整个 CV 产业链有一层更深远的影响。如果视频生成模型可以成为统一视觉感知的基础模型,那么依赖“任务专用模型”的商业模式将面临重构。Segment Anything 的成功建立在“一个模型搞定所有分割”的叙事上,但 GenCeption 暗示了一个更激进的叙事:一个模型搞定所有视觉任务。
在笔者看来,未来两年最值得关注的,不是 GenCeption 本身能否商业化,而是它开启的“生成式预训练+感知微调”这条技术路线,会不会成为计算机视觉领域的新标准范式,就像 BERT 在 2018 年改变了 NLP 一样。
如果这条路走通了,那些还在为每个视觉任务单独标注数据、单独训练模型、单独部署推理管线的团队,改变的时间窗口,可能比想象中更短。
视频生成模型学到的,不只是如何生成像素。它学到的,是如何理解世界。而一旦理解了世界,生成和理解,本就是同一枚硬币的两面。
这就是 GenCeption 最核心的洞见:会画的人,必然已经会看。






快报