视觉满分,科学零分:Sci-VBench撕开AI视频的知识推理遮羞布

2026.08.11 11:24
COLM 2026接收的论文Sci-VBench构建了1,253个专家标注的评测样本,覆盖60个科学学科,对16款前沿视频生成模型进行了科学推理能力测试。结果发现,所有模型在视觉质量上难分高下,但在科学因果正确性维度上集体失分——闭源最好成绩Gemini-Omni-Flash仅3.34分(满分5分),开源最好的MiniMax-H3仅1.60分。论文指出视频生成的核心瓶颈已从像素层转移到认知层,行业竞争焦点将从“好不好看”转向“对不对”。

2026年,你随便打开一个AI视频生成工具,输入“一只玻璃杯从桌上摔落”,得到的画面几乎完美。但如果你追问碎片为什么朝那个方向飞,动量守恒如何体现?模型沉默了。

这不是特例。8月10日被COLM 2026接收的论文Sci-VBench给出了一个冷水般的结论:当前最先进的视频生成模型,在科学推理和因果正确性面前,几乎交了白卷。

当AI视频遭遇“理科考试”

五位研究者构建了这套评测基准,请来各学科专家手工标注了1,253个评测样本,覆盖自然科学、医疗健康、人文社科和工程学四大门类、60个细分学科。每个样本都是“知识推理密集型”提示词,要求模型生成的视频在物理机制、因果链条、科学原理上站得住脚。

研究团队评测了16款前沿模型,包括8款闭源和8款开源。闭源阵营包括Sora-2、Veo-3.1、Kling-2.6、Wan-2.6、Seedance-2.0、HappyHorse-1.1和Gemini-Omni-Flash等。开源阵营包括HunyuanVideo-1.5、Wan2.2-5B、CogVideoX1.5-5B、MiniMax-H3等。

结果高度分裂。在视觉纹理质量等传统指标上,所有模型得分集中,差距极小。但切换到科学因果正确性维度,差距急剧拉开。Gemini-Omni-Flash得分3.34(满分5分),而开源最好的MiniMax-H3仅1.60。Sora-2得分仅2.72,Kling-2.6为1.71。所有模型在科学因果正确性上的得分都远低于视觉质量维度。

论文作者判断:视觉真实感的进步,并未转化为对科学动力学和因果动力学的可靠建模能力。

为什么AI视频“看得懂”却“想不通”

当前视频模型像是一个视觉皮层极度发达、但前额叶几乎没有发育的大脑。扩散模型和DiT架构擅长学习纹理、光影、轮廓等表层统计规律,但这些东西本质上是对训练数据的“记忆重组”,而非对物理因果结构的理解。

Sci-VBench的1,253个样本大量利用“分布外”测试。专家设计的提示词要求模型在特定科学约束下生成内容,这些约束组合在训练数据中出现的频率极低。它不是在考“你见过这个画面吗”,而是考“你理解画面背后的原理吗”。

在科学因果正确性维度上,闭源模型与开源模型之间的鸿沟触目惊心。Gemini-Omni-Flash得分为3.34,而MiniMax-H3仅1.60,差距超过一倍。但更值得注意的是,闭源模型绝对得分也不高。Gemini-Omni-Flash也仅能正确解释约三分之二的科学因果关系。

开源模型在视觉质量上已逼近闭源,Cosmos3-Nano的视觉纹理得分4.02,高于多数闭源模型。但在科学因果正确性上集体失守。这说明了一个残酷的事实:之前的评测基准在测的是一个错误的东西。 视觉质量的天花板已被摸到,但真正区分模型智能水平的因果推理能力,被传统评测体系完全忽略了。

研究团队还构建了一套基于打分规则的评测协议,即使非专家的评测者也能与专家评分达到较高一致性。更关键的是,他们验证了MLLM-as-Judge的可行性,让GPT-4o、Claude充当评测者同样与专家评分高度相关。这为行业提供了一个可扩展的评测范式。

当“好看”成为过去时

Sci-VBench标志着视频生成行业从“好不好看”到“对不对”的思维转折。过去两年,Sora、Kling-2.6、Veo-3.1轮番刷榜,核心叙事是“谁更逼真”。但这场竞赛的边际收益正在递减,VBench等传统基准上顶级模型差距已缩至个位数百分比。

当AI视频被用于科学教育、医学模拟、工程演示时,“好看”远远不够。一个演示光合作用的视频,如果叶绿体位置错了、光反应时序乱了,画面再精美也是垃圾。

Sci-VBench给行业的最大启示是:当前视频生成技术的核心瓶颈,已经从像素层转移到认知层。 视觉真实感是入场券,绝不是护城河。当模型在科学推理维度上集体失分,说明整个行业的能力底座还远未成熟。

论文也给出了积极信号:提示词改写能改善提示遵从度和科学因果正确性得分,说明部分问题源于模型对复杂科学指令的理解不足。但改写对时空一致性维度影响有限,许多时序失败是生成器本身的结构性缺陷。

接下来的竞争焦点将从“算力军备竞赛”转向“认知能力竞赛”。谁能率先让模型在生成视频时理解物理因果和科学知识约束,谁就能打开科学教育、医学模拟等toB应用的大门。

当AI视频不再满足于“骗过眼睛”,而是学会“讲出道理”,那才是真正的世界模拟器诞生的时刻。在此之前,所有“看起来像真的”都只是高级的障眼法。

作品声明:内容由AI生成

快报

更多

2026-09-29 23:08

商务部就媒体报道欧盟相关成员国推动欧委会打造欧版“301”工具事答记者问

2026-09-29 23:07

国内商品期市夜盘收盘涨跌参半,油脂油料涨幅居前

2026-09-29 23:02

美国30年期国债收益率创2002年以来新高

2026-09-29 22:55

生态环境部部长黄润秋会见中国环境与发展国际合作委员会外方执行副主席、加拿大环境与气候变化部部长达布鲁辛

2026-09-29 22:45

特朗普:将通过行政令把“人工智能”更名为“超级智能”

2026-09-29 22:39

甲骨文股价大涨8%,将联合NetApp推出原生OCI存储服务

2026-09-29 22:32

Claude.ai、Claude Code等服务出现故障,Anthropic正在调查

2026-09-29 22:28

美国8月份职位空缺降至五个月低位,裁员人数依然较少

2026-09-29 22:25

2026金融街论坛年会将于10月19日在京开幕

2026-09-29 22:23

美国9月消费者信心跌至十二年以来最低,对经济和就业看法悲观

2026-09-29 22:19

OpenAI年度经常性收入接近700亿美元,企业业务收入较7月翻倍

2026-09-29 22:13

千里科技:子公司拟3443.88万元购买极氪智能驾驶相关资产

2026-09-29 22:07

伊朗革命卫队称波斯湾已无美军舰船

2026-09-29 22:06

中国位居2026全球创新指数第十

2026-09-29 22:04

同有科技:目前公司SSD产能在生产高峰时已基本达到满产状态

2026-09-29 22:04

iQOO16正式发布并开售

2026-09-29 22:02

纳斯达克中国金龙指数跌超2%

2026-09-29 22:00

费城半导体指数涨幅扩大至2%,ARM股价涨超5%

2026-09-29 21:52

三峡新材:全资子公司5140万元竞得宜昌市夷陵区红岩头玻璃用砂岩矿采矿权

2026-09-29 21:52

美国30年期国债收益率升至2004年以来新高