前xAI视频多模态负责人离职揭示行业瓶颈:视频模型的天花板竟是语言模型

2026.06.03 17:13
前英伟达Cosmos核心作者、xAI Grok Imagine负责人Ethan He离职转向语言模型研究,称视频模型最大瓶颈是语言模型。他分享小团队高效迭代、视频依赖语言模型提示词重写等观点,预测未来生成式界面将成交互前端,语言模型将自主管理上下文。

前xAI视频多模态负责人Ethan He在近期访谈中提到,视频模型真正的天花板在于语言模型,这正是他选择离职、转而投入语言模型研究的核心原因。Ethan曾是英伟达Cosmos视频基础模型的核心作者,2025年中加入xAI后,仅用三个月就从零搭建出Grok Imagine 0.9,并主导开发了音频视频联合生成、视频扩展等功能。

他总结了xAI能快速取得成果的两个关键因素:一是小而精的团队结构——成员能力出众、目标高度一致,沟通成本极低;二是将迭代速度放在首位,比起追求单次训练的完美,更重要的是每天能完成更多实验,模型质量的提升往往源于数据管道和训练流程中微小bug的修复。

视频模型训练通常分为四个步骤:先训练图像模型,为语言理解打下基础,再将其迁移到视频任务上;借助VLM生成精准的文本-视频对,解决数据对齐问题;通过VAE将视频帧压缩到低维潜空间;最后训练扩散Transformer生成视频。推理阶段则通过步骤蒸馏优化生成速度,Cosmos已实现1-4步生成。

他提到视频模型的训练成本极高:存储10亿条视频需要5PB空间,月存储费约23万人民币,数据出口的费用则更高,I/O瓶颈很容易拉低GPU的利用率。理想的世界模型需要满足交互性、实时性和长时程三个条件,目前的视频模型离这些要求还有不小差距,xAI的视频扩展功能虽解决了历史上下文的问题,但真正的解决方案在于让模型能自主提取相关信息。

语言模型是视频模型智能水平的核心支撑:扩散模型需要依赖更大规模的语言模型进行提示词重写,把用户的简单输入转化为更详细的描述,从而提升生成质量。语言模型还能调用工具、协调智能体、规划视频布局。音频视频联合生成的难点在于音乐连续特征处理和时间精确对齐。

Ethan预测,未来扩散模型会成为人机交互的前端,语言模型和代码则在后端提供支持,用户界面能实时生成且高度个性化。他选择转向语言模型研究,重点关注模型对上下文的自主管理能力,相信未来的模型能主动压缩或保留上下文,甚至能自我调整运行规则。

他的职业经历也带来一些启示:在机器学习领域内切换研究方向其实并不难,训练大模型的核心原则是相通的,不需要完全从零开始。

作品声明:内容由AI生成

快报

更多

13:01

亚盛集团:厄尔尼诺现象对公司未来的影响存在不确定性

12:45

马克·古尔曼:苹果首款折叠屏手机被命名为“iPhone Duo” 起售价2000美元

12:03

港股午评:恒生指数平收,恒生科技指数跌0.58%

12:00

海底捞股东减持价格定在每股10.62港元,较周二收盘价低6.7%

11:39

A股午评:三大指数早盘涨跌不一,煤炭开采加工板块低开高走

11:36

国内期货主力合约涨跌不一,SC原油涨近5%

11:26

中秋国庆假期机票预订量已超813万张,国内航线增14%、出入境涨7%

11:19

京东云与摩尔线程达成深度合作,拟建十万卡国产智算集群

11:16

阿里国际站:美国市场领涨9月采购节,AI搜索带动交易额提升36%

11:16

上期所原油连续主力合约日内涨5%,报738.50元/桶

10:59

世界模型及数采创业公司无问智科完成数亿元A轮融资,洪泰领投

10:58

港股餐饮消费股持续走低,海底捞跌超8%

10:57

军工板块震荡拉升,湖南天雁涨停

10:56

沪深两市成交额突破1万亿,较上一日此时缩量超500亿

10:55

现货白银日内涨幅扩大至1%,报66.43美元/盎司

10:52

海底捞跌超8%,创四年半来盘中新低

10:45

PCB概念持续走强,奥士康涨停创历史新高

10:39

韩国KOSPI指数上涨2%,报7,093.86点

10:38

京东启动“物理AI加速计划”,五年内将采购300万台机器人、100万台无人车及10万架无人机

10:36

中国研发投入前1000家民企研发投入总额达1.59万亿元,同比增长10.72%