67%的好莱坞主流工作室已将AI用于预可视化流程,AI电影市场正以25.7%的年复合增速扩张,预计十年后规模突破140亿美元。但如果你以为这意味着导演们正在像玩文字游戏一样输入提示词、一键生成整部电影,那就大错特错了。
事实恰恰相反。过去两年,从OpenAI在2026年3月悄然关停Sora,到无数AI视频产品困在“玩具”阶段无法进入专业管线,行业正在经历一场深刻的反思:AI生成内容最大的问题,从来不是画面不够精美,而是你生成的东西,你改不了。
不能改,意味着不能迭代。不能迭代,意味着无法真正进入任何专业创作工作流。一部电影、一个游戏、一座建筑,在最终成品之前,需要经过成百上千次修改:场景往左移两米,镜头从俯拍改成平视,角色动作从走变跑,天色从黄昏变成夜晚。这些在传统3D工具中只需几分钟的操作,在今天的AI生成模型面前,等于要求它从零开始重新生成一切。
2026年8月,一篇来自北京交通大学、北京大学、北京师范大学、北京人工智能研究院,合作方包括Mootion AI的论文,试图从根上解决这个问题。它的名字叫StateFlow,核心思想只有一句话:不要生成视频,要生成一个可编辑的3D世界。
预可视化:被AI遗忘的千亿级战场
在讨论StateFlow之前,我们需要理解一个被大多数AI公司忽视的市场“预可视化”。
预可视化,是创意和生产之间的中间层。在电影开拍之前,导演需要看到场景布局、镜头运动、角色走位的大致效果;在游戏开发之前,设计师需要验证关卡的视觉节奏和空间逻辑;在建筑动工之前,甲方需要确认一座大楼在不同光线下的视觉效果。所有这些都需要“先画出来看看”,但“画出来”的成本极高。
传统预可视化制作周期长达数周甚至数月,需要专业3D美术师、动画师和技术指导共同完成。一个中等规模的电影预可视化项目,成本通常在数十万到数百万美元之间。这就是为什么好莱坞67%的头部工作室已经开始将AI引入预可视化流程。不是因为AI有多好,而是因为传统流程实在太贵太慢。
但现有的AI方案存在一个根本性的缺陷:它们把“预可视化”等同于“生成一段视频”。输入一段提示词,输出一段画面。如果导演说“把镜头拉近一点”,绝大多数AI视频模型只能生成一段全新的、完全不同的画面。角色变了,场景变了,光影变了,甚至连镜头语言都变了。这就是业内所说的“身份漂移”和“时空不一致”,这个问题的根源比大多数人想象的要深。
一次性生成的死胡同
StateFlow的论文开篇就指出了这个问题的本质:世界是由多个元素构成的,每个元素有几何、外观、空间姿态和语义属性,再加上相机配置。不同镜头本质上是对同一组共享状态的局部修改和重组,而不是从头生成。
这句话听起来像常识,但几乎所有的AI生成模型都不遵循这个逻辑。它们的工作方式是“一次成像”:一张图像或一段视频,从一个随机噪声开始,通过扩散过程逐步去噪,最终输出一个固定结果。这个过程中,没有“场景”的概念,没有“对象”的概念,没有“相机”的概念。只有一个像素矩阵。
这意味着,如果你想修改生成的画面中的某个元素,比如把桌子上的杯子从右边移到左边,你只能重新输入一段更详细的提示词,祈祷模型能理解你的意图。但模型不会真的去“移动”杯子,它只会生成一张新的图片,而这张新图片里的杯子可能在左边,也可能在右边,甚至可能变成花瓶。
这种不可控性在文生图领域还能勉强容忍。毕竟一张图改不了就再生成一张。但在视频领域,这是致命的。一段10秒的视频需要24帧每秒,也就是240帧连续的图像,任何一帧出现“漂移”都会破坏整个画面的连贯性。
StateFlow论文的核心判断是:预可视化缺少的是一个显式且持久的工作状态。换句话说,AI生成应该有一个“中间层”,一个可编辑、可持久化、可重复访问的3D世界表征,而不是直接从提示词跳到像素。
StateFlow的解法:三条路径,一个世界
基于这个洞察,StateFlow提出了一个三阶段框架,将预可视化拆解为“构建”“演化”“访问”三个核心环节。
第一阶段:状态构建——从2D到3D的先验引导
StateFlow的第一步,是将用户的自然语言意图转化为一个初始的3D场景。这听起来和传统的文本到3D生成没有区别,但StateFlow的做法有一个关键差异。它不试图一步到位从文本生成3D场景,而是先通过图像模型生成互补的视觉参考,再通过“先验引导、冲突感知的双视图初始化”机制,将这些2D内容提升为一个连贯的3D世界。
这个过程的难点在于“冲突感知”。同一物体从不同角度观看时,2D图像之间可能存在几何不一致性。比如正面看是圆形,侧面看是椭圆。StateFlow通过在两个视角之间建立先验约束,自动检测并消解这些不一致,确保3D重建的几何一致性。
第二阶段:状态演化——编辑不重建
如果说构建阶段解决的是“从无到有”的问题,演化阶段解决的是“从有到优”的问题。这也是StateFlow设计中最具实用价值的部分。
当用户想要修改场景中的某个元素,比如把建筑风格从现代换成哥特式,或者让一辆车从画面左侧驶向右侧,传统方法需要重新生成整个场景。StateFlow的做法截然不同:它将用户意图翻译为结构化的状态转换,只修改受影响的局部状态,同时保留世界记忆中不受影响的部分。
这意味着,你可以对场景进行连续迭代编辑。先换风格,再移动物体,再调整光照,每一步都是在上一步的基础上局部修改,而不是推倒重来。这种“编辑不重建”的设计,对预可视化工作流来说是最关键的体验突破。
第三阶段:状态访问——从场景到影片
构建好场景、完成迭代编辑之后,最后一步是如何“看”这个场景。StateFlow将相机控制作为独立的问题来处理,而不是和场景生成混在一起。
当用户想要一个“从低角度仰拍主角,然后慢慢拉远”的镜头时,StateFlow的“渲染反馈反射”机制会先粗算一个相机轨迹,然后通过渲染结果来评估这个轨迹的视觉可行性。有没有遮挡?构图是否合理?运动是否平滑?最后迭代优化,得到一条物理和视觉上均可行的相机路径。
当需要更高视觉保真度时,StateFlow还可以接入现成的视频生成模型,将几何基础渲染的观察增强为更具表现力的视频画面,且不改变底层世界状态。
对比实验:StateFlow到底强在哪
StateFlow论文在多个维度上进行了定量和定性对比。在3D场景生成方面,与PartCrafter、SAM3D、SynCity等基线方法对比,StateFlow生成的场景在物体完整性、空间排布合理性和多视角一致性上均显著优于现有方法。在视频生成方面,与Animaker、MovieAgent、Wan、Seedance等视频生成模型对比,StateFlow在保持身份一致性、场景布局稳定性和跨镜头连贯性方面表现突出。
但比定量指标更重要的是一个定性差异:StateFlow生成的不是“视频”,而是一个“世界”。这个“世界”可以被加载、编辑、重新拍摄、再次加载。就像你在虚幻引擎或Unity中做的那样,只不过现在你可以用自然语言来描述你想要什么。
产业影响:谁在争夺预可视化AI的制高点
StateFlow并非孤例。2025到2026年,围绕3D世界模型和预可视化的技术竞赛正在加速。
在国内,腾讯混元世界模型2.0于2026年4月正式发布并开源,支持一键生成可漫游、可二次编辑的3D场景,并能直接导出到Unity和Unreal Engine等游戏引擎。值得注意的是,StateFlow的第一作者尹雨阳目前正在腾讯混元3D世界模型组实习,这并非巧合。两个团队都在探索同一个方向:如何让AI不仅“生成”世界,更“理解”世界。Deemos的Rodin Gen-2以100亿参数和创新的BANG架构刷新了3D生成AI的规模天花板。Mootion AI作为StateFlow的合作方之一,专注于AI驱动的3D内容创作。
在国际上,Google DeepMind的Genie系列世界模型也在同步进化。Genie 3于2025年8月发布,能够根据单张图片生成实时交互式3D模拟环境。但Genie系列的核心定位是机器人训练模拟器,而非影视预可视化。它生成的是“可玩的模拟”,而不是“可编辑的场景”。这正是StateFlow的差异化所在。它面向的是创意产业,而非AI Agent训练。
虚拟制作市场正在同步扩容。据Fortune Business Insights数据,2025年全球虚拟制作市场规模为38.3亿美元,其中北美市场以32.9%的份额占据主导,贡献12.6亿美元营收。AI在电影市场的渗透率同样在快速提升。2024年全球AI电影市场规模为18亿美元,预计到2033年将达到141亿美元(Market.us, 2025年5月)。
这些数据指向一个清晰的方向:预可视化正在从“专家工具”变成“AI原生应用”。而在这个转变中,掌握“持久世界状态”这一核心技术的团队,将拥有定义下一代创作工具的话语权。
挑战与局限
StateFlow在理念上令人信服,但距离真正成为行业标准,还有几个关键问题需要解决。
首先是实时性问题。当前StateFlow的控制流程,用LLM理解用户意图、调用现成模型生成2D参考、通过多视图重建构建3D场景,每一步都需要秒级甚至分钟级的计算时间。对于真正的交互式预可视化,这个速度还不够。
其次是3D表示的精度。StateFlow使用的对象级结构化3D表示,在保持几何一致性的同时,也限制了其对复杂细节的处理能力,如流体、烟雾、毛发等细粒度效果。如何在这些细节和结构化表示之间取得平衡,仍是一个开放问题。
最后是与其他工具的互操作性。在真实的影视和游戏制作管线中,预可视化只是第一步,后续还需要导出到专业的3D渲染引擎和游戏引擎。StateFlow当前的输出格式和标准化程度,尚不足以直接嵌入现有的工业管线。
论文作者在结论部分也坦承了这些局限性,并指出通过更高效的推理策略、与更精细的3D生成模型结合、以及更好的多模态对齐,是未来改进的方向。
从Sora的“一次成像”到StateFlow的“持久世界”,AI生成视频正在经历一场从“生成结果”到“生成过程”的范式转换。当AI不仅会“画”出一个世界,还学会让这个世界可以被编辑、被迭代、被反复观看时,预可视化这个千亿级市场,才算真正找到了属于它的AI时刻。
毕竟,创意的本质从来不是生成完美的结果,而是拥有无限次修改的权利。






快报