你已经习惯了在文档库里输入关键词就能找到需要的那段文字。但如果要找的不是文字,而是一段10分钟足球比赛录像里的“那个点球”——在2026年之前,这需要串联转写服务、帧提取管线、嵌入模型和向量数据库,像拼乐高一样拼出一条复杂的技术链路。今天,AWS和TwelveLabs把这个链条拧成了一键式操作。
当视频遇见自然语言
9月10日,AWS正式宣布TwelveLabs Marengo Embed 3.0作为嵌入模型在Amazon Bedrock Knowledge Bases中全面可用。这不是一次常规的模型上线——它意味着企业第一次可以在一个完全托管的服务中,用自然语言搜索视频、图片和音频内容,无需搭建任何中间件。
在此之前,多模态检索的企业落地意味着什么?一个无法回避的现实是:视频和媒体资产在企业内部几乎处于“语义不可搜索”的状态。据IDC统计,2024年全球产生的数据总量约147ZB,而Gartner的数据显示,80%的企业数据是非结构化的——包括邮件、聊天记录和视频文件。每一帧存储都在花钱,但绝大多数无法被有效调取。
Marengo Embed 3.0是一个多模态嵌入模型,它将视频、音频、图像和文本统一编码到一个512维向量空间中。这个512维是一个关键数字——相比之下,Amazon Nova的嵌入维度是3072维,Google Vertex是1408维。低维度直接意味着更低的存储成本和更快的检索速度。
AWS Bedrock Knowledge Bases是一个完全托管的RAG(检索增强生成)服务,负责存储、摄取、嵌入、重排序和检索的全流程。它支持MP4、MOV格式的视频文件,JPEG、PNG格式的图片以及音频轨道,并通过Amazon S3、SharePoint、Confluence等内置连接器摄取数据。
两者结合后的效率提升是跳跃式的:企业只需把视频上传到S3,在Bedrock控制台中选择Marengo Embed 3.0作为嵌入模型,点击同步。Managed Knowledge Bases会自动完成视频分段、帧采样、转写、嵌入向量生成和索引写入的全过程。默认每4秒一个分段,全程零代码。
真正的问题不是“搜不到”,而是“搜不到意义”
大多数企业存储视频的方式,本质上是在存一个黑箱。文件系统能记录文件名、上传日期和文件格式,但对内容本身一无所知。即便配上人工标签和笔记,面对每分钟都在产生的会议录像、培训视频和监控影像,人工标注的效率只能覆盖极小比例的内容。
AWS官方博客使用了一个精准的用例来说明问题:在2022年世界杯决赛10分钟录像中搜索“下半场的点球”。传统方案是猜文件名、手动拖动进度条、或者祈祷录像配有字幕。Marengo 3.0的方案是:将视频分割成4秒一段的片段,为每个片段的视觉、音频、文本信号生成统一嵌入向量,然后直接用“show me the penalty kick in the second half”这个自然语言查询做语义匹配。
这种差异的本质不是速度或准确率的线性提升,而是搜索范式的转换:从关键词匹配走向语义理解。视频搜索的“文本化”之所以关键,是因为它把人类最自然的交互方式——说一句完整的话——变成了搜索接口。
512维背后的技术博弈
Marengo 3.0的技术参数值得细看。综合性能数据来自TwelveLabs官方测试:Marengo 3.0在视频、音频、图像和文本检索的复合基准测试中达到78.5%,对比Amazon Nova的61.8%和Google Vertex的50.2%。在延迟维度上,Marengo 3.0处理每秒视频只需0.05秒,Vertex约需0.5秒,Nova超过1.5秒。
对短于60秒的视频,Marengo 3.0约10秒完成处理,Nova需要约110秒——11倍的差距。对长达1小时的视频,Marengo 3.0约310秒(略多于5分钟),Nova约590秒(接近10分钟)。这意味着处理1000小时的视频库,两者对应的计算时间分别是86小时和164小时——几乎翻倍的差距,直接决定了企业的time-to-market和基础设施成本。
512维的嵌入空间是另一层博弈。维度越低,单个向量的存储开销越小,向量相似度搜索的延迟越低。Marengo 3.0的512维比Nova的3072维节省约6倍存储空间,比Vertex的1408维节省约3倍。在同等基础设施预算下,企业可以索引更大规模的视频库。
但低维度并不天然意味着低精度。Marengo 3.0证明了在精心设计的训练目标和数据策略下,紧凑的嵌入向量可以同时实现更高的检索精度和更低的运营成本。在业界最权威的MSRVTT基准上,Marengo 3.0得分72.5,高于Marengo 2.7的71.7、Nova的69.6和Vertex的59.5。在VATEX基准上,Marengo 3.0达到86.4——领先优势在持续扩大。
AWS为什么要“养”一家挑战者?
反直觉的细节在这里:AWS既在Bedrock里提供自家的Amazon Nova模型,又引入了TwelveLabs作为第三方嵌入模型,且Marengo 3.0在多项指标上显著优于Nova。AWS为何甘愿“被碾压”?
答案藏在Bedrock的平台战略里。Bedrock不是卖模型的产品——它是一个模型市场加托管基础设施。AWS的价值主张从来不是“我们的模型最好”,而是“你的数据可以在我们这里安全地处理”。引入最好的第三方模型来吸引更多企业将多模态数据存入AWS生态(S3、OpenSearch Serverless、Bedrock),远比模型层面的盈亏重要。
这个逻辑和AWS Marketplace、Amazon EC2上运行竞争对手软件的策略一脉相承:赚流量的钱,而不是赚应用的钱。TwelveLabs在2026年7月完成1亿美元B轮融资,由NEA和NAVER Ventures联合领投,Amazon直接参与此轮投资。两家的合作关系甚至超越资本层面——AWS是TwelveLabs首选云提供商,双方签署了多年战略合作协议,包括在AWS Trainium芯片上优化TwelveLabs的视频推理负载,且新模型将优先在AWS上首发。
AWS用资本、算力和渠道三张牌锁定了这家视频AI赛道上最具势能的初创公司——即使它的模型在基准测试中输给了这家初创。
视频搜索正在消失
多模态检索进入“托管控”时代,三层影响值得关注。
对企业的第一层影响:视频作为数据资产的“利用率鸿沟”将被加速填平。据Gartner数据,80%的企业数据是非结构化的,而传统搜索方案几乎无法处理其中的视频部分。Marengo 3.0加Bedrock的组合,直接把多模态检索从“需要3人团队花3个月搭建”压缩成“一个人一下午配置完成”。对媒体、体育分析、教育、安防和零售行业而言,这意味着之前“存着但用不了”的视频资产第一次变得可调用、可检索。
对竞争格局的第二层影响:AWS Bedrock目前同时支持Titan Text、Nova和Marengo 3.0等嵌入模型,Google Cloud则有Vertex AI。但差距在执行层——Bedrock的Managed KB把分段、嵌入、检索全链路封装成一个产品,这种“用完即走”的体验才是企业客户真正关心的。
对行业趋势的第三层影响,也是更长期的判断:当视频变得像文本一样可搜索,“视频搜索”这个概念本身可能会消失——它会变成“搜索”。企业不再需要区分“我在搜文档”还是“我在搜视频”,所有内容在同一套语义索引中平权存在。那才是这场技术集成的终点。
当视频不再需要“被搜索”,而是像文字一样被理解,企业的每一帧历史才真正从存储空间变成了可调用的记忆。对大多数人而言,这是今天忽略的一条新闻;对少数人而言,这是明天竞争的一个起点。






快报