1000万小时、8000万视频全部MIT许可:LAION正在复制它在图像时代的历史剧本

2026.08.26 13:30
LAION发布了LAION-BVD,一个包含13亿条URL、8000万视频、总时长1000万小时的开放视频数据集,全部以MIT许可发布。这是目前最大的公开视频数据资源,规模是InternVid的13倍。当OpenAI、Google、Meta都把视频模型和数据锁在围墙后时,LAION正在用透明的方式为开源社区提供多模态训练的弹药,试图在视频赛道上复刻当年LAION-5B催生Stable Diffusion的历史剧本。

2026年8月,当OpenAI正式关停Sora的web和app体验、Google把Veo锁在Cloud API后面、Meta虽然开源了Movie Gen但训练数据依然秘而不宣时,一个德国非营利组织不声不响地甩出了一张牌:1000万小时,8000万个视频,全部MIT许可。

这个组织叫LAION。五年前,它用LAION-5B的50亿图文对喂出了Stable Diffusion,掀起了一整波AI图像生成的产业浪潮。如今,它正在视频多模态的赛道上,试图复制同一个剧本。

问题是,这一次故事会一样吗?

13亿URL到1000万小时:一颗超大规模数据管道的运转实录

LAION-BVD的全称是LAION Big Video Dataset。从CommonCrawl撒网、批量下载、场景检测、到合成标注,这条管线本身就是一篇工程论文。

先看核心数字:从CommonCrawl中提取了13亿条平台特异的视频URL,实际成功下载了8000万条视频,视频总时长达到1000万小时。经内容感知的场景检测后,提取出5500万个视频片段并生成了视频和音频描述。此外还额外提取了3亿帧场景变化画面,可用于图像-文本预训练。

数据集以多个版本在HuggingFace上发布。从最轻量的仅URL列表(BVD-URLs),到完整的原始视频合集(BVD-RAW),再到音频专用子集(BVD-A-10M含1000万音频片段)和图像帧子集(BVD-I-300M含3亿帧),覆盖了视频、音频、图像三个模态的独立需求。研究者可以根据算力预算选取合适规模,不用每次都下载1000万小时的原始视频。

1000万小时是什么概念?一个人连续不间断地看,需要1140年。以每秒24帧计算,相当于8640亿帧画面。而此前最大的公开视频数据集InternVid(上海AI实验室出品)总时长约为76万小时,LAION-BVD是它的13倍。另一个常用基线WebVid-2M仅含250万条短视频。

更关键的是,这些视频原生携带音频。LAION用Whisper提取音频转录、用视觉语言模型生成视频描述、用场景检测做智能切分。一个数据集,覆盖了视频-文本、音频-文本、图像-文本三条预训练路线。

性能验证:ViCLIP高出2.1%,CLAP和CLIP紧随其后

LAION公布了在三类模型上的验证结果。

在视频-语言(ViCLIP)方向,用LAION-BVD训练的ViCLIP模型,在标准视频文本基准测试中匹配或超越了InternVid训练的模型,最高领先2.1个百分点。而且训练规模从1000万片段提升到5000万片段时,性能持续提升,说明数据集具备良好的扩展性。

在音频-语言(CLAP)方向,LAION-BVD训练的CLAP模型利用视频中提取的真实世界声景,达到了与其他大规模非精选音频数据集有竞争力的表现。

在图像-文本(CLIP)方向,基于视频帧训练的CLIP模型在标准图像文本检索任务上表现强劲。更值得关注的发现是:视频帧展现出的视觉分布与典型网络图像不同。这意味着它提供了一种互补的训练信号,而不是简单的替代品。

这些数字的意义不在绝对值,而在一个信号:用开源数据和开源工具链,可以训练出和闭源或半开源数据竞争的视频多模态模型。

视频成为AI的下一个主场,数据就是弹药

LAION的故事自带戏剧性。创始人Christoph Schuhmann是一位德国高中老师,2021年在Discord上遇到两个志愿者,三人从零搭建了LAION-400M(4亿图文对)。随后扩展到LAION-5B的50亿图文对,直接催生了Stable Diffusion,间接推动了整个AI图像生成产业的爆发。

LAION的角色定位很清楚:它不训练模型,不做产品,它是做弹药库的。谁拿到这些弹药,谁就能造出自己的武器。

现在,这个剧本在视频领域重演。

但视频数据集的构建难度比图像高一个数量级。

首先是存储和传输成本。1000万小时视频需要的带宽和存储是天价。LAION用分布式P2P网络和志愿者节点分摊成本,这和它们做LAION-5B时的策略一脉相承。

其次是标注难度。图像的语义基本在一帧之内,而视频的语义是时间序列的函数。LAION用video2dataset工具链实现了自动化管线:yt-dlp批量下载、帧率和分辨率降采样、场景检测切分、Whisper提取音频转录、VLM生成视频描述。整个流程端到端可复现,代码全部公开在GitHub上。

第三是版权困境。LAION-5B曾在斯坦福研究人员发现其中包含CSAM内容后陷入大规模伦理争议,最终一度撤回。视频数据比图像更敏感,人脸、声音、私密场景全部包含在内。LAION-BVD在发布声明中明确标注仅限研究用途、不得用于商业,并承认数据集可能存在偏见和不均衡。这是在法律灰色地带中的一种务实防守。

即便如此,LAION做了一件闭源巨头不会做的事:透明公开。GitHub上可以查到每一步代码,从下载、过滤、标注到训练。你可以质疑它的数据质量,但你无法质疑它的开放性。

谁会受益,谁会被冲击

LAION-BVD的出现,正在改变视频多模态领域的竞争版图。

最大的受益者是学术研究者。此前只能在WebVid-2M的250万视频上做实验的课题组,现在可以直接扩展到千万级。视频多模态研究的门槛被大幅拉低。

开源视频模型项目也是直接受益者。ColossalAI的Open-Sora、HuggingFace社区的各类视频模型、LTX-Video等项目,不再需要自建昂贵的数据管道。它们可以把省下的预算投入到模型架构和训练策略的改进上。

潜在的输家是那些靠售卖视频标注数据为生的商业公司。如果LAION持续提供免费的大规模视频数据,商业视频数据集的市场空间会被大幅压缩。视频标注这门生意本来规模就不大,LAION-BVD的出现可能让它彻底边缘化。

另一个潜在冲击对象是闭源巨头的数据叙事。当开源社区能够用体量和Sora训练数据相当的规模进行训练时(Sora的训练规模从未公开,但1000万小时至少在同一量级),闭源模型因为数据规模所以更好的叙事护城河会变浅。Movie Gen虽开源了模型权重,但训练数据并未公开;Veo和Sora则完全不透明。LAION-BVD直接绕开了这个黑箱。

但风险不能被低估。LAION-5B的前车之鉴(CSAM争议、被多个地区投诉)说明大规模网络爬取数据集的法律地基并不稳固。视频数据集的版权争议只会更大。YouTube、TikTok、Instagram等平台的用户生成内容,在被爬取后用于AI训练时的法律边界,目前在全球范围内都处于模糊地带。仅限研究用途的声明在法庭上能提供多少实质保护?这个问题没有答案。

结语:钥匙交给所有人

2026年的多模态AI格局正在形成一条清晰的分界线。一侧是OpenAI、Google、Meta等巨头,它们拥有最多的算力和最优质的数据,但核心模型和数据都不透明。另一侧是LAION和开源社区,用透明的方式建设基础设施。虽然粗糙,但开放。

LAION-BVD意味着,在视频多模态这条赛道上,开源社区终于有了和巨头对等的弹药储备。技术的差距可以用数据来弥补,而数据的差距,正在被一个德国非营利组织抹平。

数据质量和版权合规这两座大山仍未翻越。但历史已经证明:当LAION把4000万图文对放到网上时,没人想到它会催生Stable Diffusion;当它把50亿图文对放到网上时,没人想到它会改变整个AI图像生成产业。

把钥匙交给所有人,总有人能用它打开一扇新的门。

作品声明:内容由AI生成