视觉满分,科学零分:Sci-VBench撕开AI视频的知识推理遮羞布

2026.08.11 11:24
COLM 2026接收的论文Sci-VBench构建了1,253个专家标注的评测样本,覆盖60个科学学科,对16款前沿视频生成模型进行了科学推理能力测试。结果发现,所有模型在视觉质量上难分高下,但在科学因果正确性维度上集体失分——闭源最好成绩Gemini-Omni-Flash仅3.34分(满分5分),开源最好的MiniMax-H3仅1.60分。论文指出视频生成的核心瓶颈已从像素层转移到认知层,行业竞争焦点将从“好不好看”转向“对不对”。

2026年,你随便打开一个AI视频生成工具,输入“一只玻璃杯从桌上摔落”,得到的画面几乎完美。但如果你追问碎片为什么朝那个方向飞,动量守恒如何体现?模型沉默了。

这不是特例。8月10日被COLM 2026接收的论文Sci-VBench给出了一个冷水般的结论:当前最先进的视频生成模型,在科学推理和因果正确性面前,几乎交了白卷。

当AI视频遭遇“理科考试”

五位研究者构建了这套评测基准,请来各学科专家手工标注了1,253个评测样本,覆盖自然科学、医疗健康、人文社科和工程学四大门类、60个细分学科。每个样本都是“知识推理密集型”提示词,要求模型生成的视频在物理机制、因果链条、科学原理上站得住脚。

研究团队评测了16款前沿模型,包括8款闭源和8款开源。闭源阵营包括Sora-2、Veo-3.1、Kling-2.6、Wan-2.6、Seedance-2.0、HappyHorse-1.1和Gemini-Omni-Flash等。开源阵营包括HunyuanVideo-1.5、Wan2.2-5B、CogVideoX1.5-5B、MiniMax-H3等。

结果高度分裂。在视觉纹理质量等传统指标上,所有模型得分集中,差距极小。但切换到科学因果正确性维度,差距急剧拉开。Gemini-Omni-Flash得分3.34(满分5分),而开源最好的MiniMax-H3仅1.60。Sora-2得分仅2.72,Kling-2.6为1.71。所有模型在科学因果正确性上的得分都远低于视觉质量维度。

论文作者判断:视觉真实感的进步,并未转化为对科学动力学和因果动力学的可靠建模能力。

为什么AI视频“看得懂”却“想不通”

当前视频模型像是一个视觉皮层极度发达、但前额叶几乎没有发育的大脑。扩散模型和DiT架构擅长学习纹理、光影、轮廓等表层统计规律,但这些东西本质上是对训练数据的“记忆重组”,而非对物理因果结构的理解。

Sci-VBench的1,253个样本大量利用“分布外”测试。专家设计的提示词要求模型在特定科学约束下生成内容,这些约束组合在训练数据中出现的频率极低。它不是在考“你见过这个画面吗”,而是考“你理解画面背后的原理吗”。

在科学因果正确性维度上,闭源模型与开源模型之间的鸿沟触目惊心。Gemini-Omni-Flash得分为3.34,而MiniMax-H3仅1.60,差距超过一倍。但更值得注意的是,闭源模型绝对得分也不高。Gemini-Omni-Flash也仅能正确解释约三分之二的科学因果关系。

开源模型在视觉质量上已逼近闭源,Cosmos3-Nano的视觉纹理得分4.02,高于多数闭源模型。但在科学因果正确性上集体失守。这说明了一个残酷的事实:之前的评测基准在测的是一个错误的东西。 视觉质量的天花板已被摸到,但真正区分模型智能水平的因果推理能力,被传统评测体系完全忽略了。

研究团队还构建了一套基于打分规则的评测协议,即使非专家的评测者也能与专家评分达到较高一致性。更关键的是,他们验证了MLLM-as-Judge的可行性,让GPT-4o、Claude充当评测者同样与专家评分高度相关。这为行业提供了一个可扩展的评测范式。

当“好看”成为过去时

Sci-VBench标志着视频生成行业从“好不好看”到“对不对”的思维转折。过去两年,Sora、Kling-2.6、Veo-3.1轮番刷榜,核心叙事是“谁更逼真”。但这场竞赛的边际收益正在递减,VBench等传统基准上顶级模型差距已缩至个位数百分比。

当AI视频被用于科学教育、医学模拟、工程演示时,“好看”远远不够。一个演示光合作用的视频,如果叶绿体位置错了、光反应时序乱了,画面再精美也是垃圾。

Sci-VBench给行业的最大启示是:当前视频生成技术的核心瓶颈,已经从像素层转移到认知层。 视觉真实感是入场券,绝不是护城河。当模型在科学推理维度上集体失分,说明整个行业的能力底座还远未成熟。

论文也给出了积极信号:提示词改写能改善提示遵从度和科学因果正确性得分,说明部分问题源于模型对复杂科学指令的理解不足。但改写对时空一致性维度影响有限,许多时序失败是生成器本身的结构性缺陷。

接下来的竞争焦点将从“算力军备竞赛”转向“认知能力竞赛”。谁能率先让模型在生成视频时理解物理因果和科学知识约束,谁就能打开科学教育、医学模拟等toB应用的大门。

当AI视频不再满足于“骗过眼睛”,而是学会“讲出道理”,那才是真正的世界模拟器诞生的时刻。在此之前,所有“看起来像真的”都只是高级的障眼法。

作品声明:内容由AI生成