Meta 扔了颗价格炸弹:20人同声传写,千分钟只要3美元

2026.09.02 09:14
Meta 于2026年9月发布首个实时音频感知模型 Muse Voice Transcribe,通过 Model API 开放调用,定价每千分钟3美元(约每小时0.18美元)。该模型在单一流程中整合流式语音识别、20余人说话人分离与端点检测,以80ms音频块边接收边处理,自适应延迟机制下词错误率仅3.1%,位列 Artificial Analysis 流式语音转文本排行榜第1名。在定价上直接对标 OpenAI GPT-4o Mini Transcribe 的同价位档,但在流式说话人分离这一核心功能上形成了差异化优势。

一场20人的产品评审会,销售、研发、市场三方同时开麦,远程接入的技术人员也在抢话。会议一结束,整理纪要的人面对的是“谁说了什么”的一团乱麻。这不是段子。这是全球每天数亿场会议中反复上演的真实成本。2026年9月1日,Meta 给出了一份出人意料的答卷——不是更贵的硬件,不是更复杂的集成,而是一个 API,定价每千分钟3美元。

现象:当 20 人的对话变成一行代码

2026年9月1日,Meta 正式发布 Muse Voice Transcribe。这是 Meta 超智能实验室(MSL)的首个实时音频感知模型,通过 Meta Model API 开放调用,定价为每1000分钟音频3美元——折合每小时0.18美元,约合人民币1.2元/小时。

这不是一个普通的语音转文字服务。它在同一模型内整合了三项能力:流式自动语音识别、说话人分离和端点检测。翻译成人话:边说边出字、自动区分谁在说话、自动判断一句话说完了没有。音频流以80毫秒为粒度切分,每个片段结束后模型决定是立即输出文字还是继续监听等待更多上下文。用户无需等待整段音频录制完毕。

在语言覆盖上,模型训练数据涵盖70余种语言,其中25种在发布时已完成验证支持。单段音频支持超过1小时,并支持句内或句间的自然语言切换。开发者还可以通过语言、关键词和上下文偏置,提升特定术语或场景下的识别准确率。

截至2026年9月1日,Muse Voice Transcribe 在 Artificial Analysis 流式语音转文本排行榜中位列第1名。Meta CEO 马克·扎克伯格在 X 平台称其“在流式语音转文本领域达到 SOTA”,并透露该模型已同步上线 Meta AI for Mac 和 Muse Code——Mac 用户按住 Fn 键即可在任意应用中实现系统级语音听写。

技术:“边说边分人”的实时博弈

流式ASR不新鲜。说话人分离也不新鲜。能同时做到实时、多说话人、端到端单一模型——在这个定价水平上,是第一次。

传统的多人会议转写方案通常采用“两段式”架构:先录一整段音频,跑ASR生成文本,再用聚类算法把文字片段分配给对应的人。这个流程天生有延迟——一段两小时的会议,你就要等两小时才能看到带标签的完整转写。

Muse Voice Transcribe 的做法是端到端一体的。模型接收音频流的同时同步解析“谁在说话”和“说了什么”,不需要分段后处理。根据 Meta 官方公布的基准测试,模型在自适应延迟模式下实现了3.1%的最终转写词错误率(AA-WER Streaming),领先于 Cartesia Ink-2(3.4%)、ElevenLabs Scribe v2 Realtime(3.6%)、GPT Live Transcribe(3.9%)和 Gemini 3.5 Transcribe Live(4.0%)。

为了实现这一点,Meta 引入了自适应延迟机制。系统对每个词独立判断:发音清晰的词快速提交转写结果;发音模糊、术语密集或语境复杂的词,多等待一段时间音频上下文再输出。每一轮80ms的音频块都像是在做一次“快与准”的实时博弈。Meta 在研究中解释说:“模型等待的时间越长,转写越准确,但延迟越高。”

不过说话人分离仍远未完美。Meta 在该维度上的公开基准误差率为17.5%,虽然领先业界,但也说明“自动区分20个说话人”在嘈杂、重叠的真实会议场景中依然是一个未完全解决的问题。

定价:$3/千分钟的真实坐标

定价是今天最让行业坐不住的信号。但也需要放准坐标系。

做一组结构化的横向对比:

  • OpenAI Whisper-1 / GPT-4o Transcribe:$0.006/分钟,即$6/千分钟。不支持原生流式说话人分离。
  • OpenAI GPT-4o Mini Transcribe:$0.003/分钟,即$3/千分钟,和 Meta 同价。同样不支持原生流式说话人分离。
  • OpenAI GPT Transcribe:$0.0045/分钟,即$4.5/千分钟。
  • Azure Speech Services:实时转写约$0.016/分钟,说话人分离作为附加功能额外计费。
  • 阿里云大模型流式语音识别:新客专享约¥2.2/小时(约$0.30/小时),不支持说话人分离。

关键差异不在总价,在“打包方式”。Meta 的 $3/千分钟是全包价:流式转写、说话人分离、端点检测,三项功能一口价。而竞品的方案要么需要加购说话人分离,要么根本不支持实时说话人分离,要么组合定价远高于 $3/千分钟。

更聪明的是计价单位本身。Meta 按“音频时长”计费,而不是按 token 或字符——这是最直观、最好预测的计量方式。开发者不需要估算一场会议会产生多少文字,只需要知道会议开了多久。月结的时候不会有“意外账单”。

当然,如果只比价格,Meta 和 OpenAI GPT-4o Mini Transcribe 处在同一档位。OpenAI 在模型通用性、生态集成度和开发者社区成熟度上仍有明显优势。Meta 的进攻不是靠单一的价格屠杀,而是靠“同价位但多一个关键功能”的功能溢价——你在别处买不到这个价位还带流式说话人分离的产品。

战略:Meta 的“低价API”逻辑

Muse Voice Transcribe 不是孤立产品。它是 Meta Model API 拼图中最新的一块。

2026年以来,Meta 在 Model API 平台上逐步铺开了 Llama 系列语言模型、图像生成模型、Muse Code 编程助手,到现在的音频感知模型。这套产品矩阵的底层逻辑很清晰:开源社区维持影响力,商业化 API 截流变现。

具体而言,策略可以描述为“亚马逊式”而非“苹果式”:不追求单次调用的高利润率,而是用极低单价拉高使用量,快速积累场景覆盖。对于一个 AI 公司,没有比海量用户的真实音频数据更好的训练燃料了——尽管扎克伯格在推文中承诺了“zero-data-retention”层级,但 Meta Model API 服务条款中明确写着:“Meta may use your Content to train, develop, evaluate, and improve Meta's AI models。”两者之间,正是企业客户最需要厘清的灰色地带。

这种定价策略把“听懂一场20人的会议”变成了一个开发者可以无感接入的基础设施成本。就像当年 Twilio 把通信变成 API、Stripe 把支付变成 API、AWS 把服务器变成 API 一样。每一条曲线都有一个共同点:价格骤降后的市场扩张远超所有预期。

一条暗线值得关注:Muse Voice Transcribe 已经原生内置在 Meta AI for Mac 和 Muse Code 中。这意味着 Meta 正在通过 Model API 建立从开发者工具到消费者应用的完整闭环——开发者用低价 API 做应用集成,终端用户在 Meta 生态内直接免费使用。一举两得。

格局:谁最危险

这一刀落下,最痛的群体有三类。

第一类:纯语音转写 SaaS 厂商。Otter.ai、Fireflies.ai、Rev.com 的核心功能就是多人会议转写加说话人标记。当 Meta 把这一能力以极低价格做成通用 API,甚至未来可能直接内置到 WhatsApp 或 Facebook Messenger 中,独立 SaaS 平台的差异化空间将急剧收窄。它们的护城河不在技术,在产品体验和垂直场景的深耕——而这一点面对 Meta 的工程资源和用户基数,能守多久是未知数。

第二类:高定价 AI API 服务商。Azure 和部分云厂商的语音 API 能维持较高定价,很大程度上因为说话人分离作为附加功能单独计价。Meta 的全包定价模式直接打破了这种定价范式——如果你的竞争策略是靠拆开功能收费来提升客单价,现在有了一个把三项功能打包卖 $3/千分钟的对手。

第三类:传统会议硬件厂商。当软件层能通过一个廉价 API 解决“谁说了什么”的问题,那些靠“内置 AI 转写”作为核心溢价点的企业级会议设备——Zoom Rooms 的 AI 伴侣、Microsoft Teams 的 Copilot 集成——将从“不可替代的工具”降级为“可选的便利”。

但 Meta 有一个绕不开的短板:数据隐私。企业级客户采购语音转写服务时,隐私和合规是第一优先级的考量。音频数据中包含完整的对话内容、说话人身份乃至语气情绪信息,远比文本输入敏感。以 Meta 过去在数据隐私方面的记录——Cambridge Analytica 事件、多次 GDPR 巨额罚款——它在这个维度上是最容易被挑战的。虽然扎克伯格提到零数据保留层级的存在,但企业客户在签约前必然要追问:哪些数据被保留?保留多久?能否通过审计?

结论:当语音感知变成水电煤

Muse Voice Transcribe 的冲击力不在于任何单一的技术指标,而在于它完成了一次“定价跃迁”——从一个需要专业软件和专用硬件的“企业级功能”,变成一个一行代码调用、按使用时长计费的“基础设施 API”。

这个剧本在云计算历史上已经上演了三次:AWS 把服务器变成了 API,Stripe 把支付变成了 API,Twilio 把通信变成了 API。每一条曲线都有一个共同特征:价格骤降后的市场扩张远超所有预期。当一项能力的价格下降到“可以忽略不计”的程度,使用场景就不再受预算约束,而只受想象力的约束。

对于开发者,这意味着实时语音识别现在是可以无压力集成的功能。对于企业采购者,这意味着需要重新审视 AI 转写服务的预算结构。对于 Meta 自身,这意味着又多了一条将超10亿用户拉入 AI 生态的管道。

未来12个月值得关注的方向:Meta 是否会将该能力深度集成到 WhatsApp Business 等社交产品的音频功能中;Google(Gemini Live 音频能力)和 OpenAI(GPT Transcribe 系列)将如何跟进定价和功能;以及最重要的——企业客户对“数据流向 Meta”的接受度究竟如何演变。

每个人都在说,但直到今天,才有 API 能真正同时听见20个人说了什么——而且只要3美元。

作品声明:内容由AI生成

快报

更多

11:20

航运板块持续走高,中远海能等多股涨停

11:16

国家体育总局:培育壮大体育线上直播、线上培训、虚拟体育、智慧运营等新业态

11:15

现货白银升至66美元/盎司,日内上涨1.04%

11:14

沪深两市成交额突破1万亿,较上一日此时缩量超1200亿

11:11

焦煤期货主力合约日内大跌4%,现报1640元/吨

11:07

MSCI亚太指数上涨1%至277.23点

11:07

沪金期货主力合约涨幅扩大至2%,报959.20元/克

11:04

国家体育总局:进一步扩大优质赛事供给,解决观赛“一票难求”问题

11:02

上海公布首批算力生态合作伙伴,38家单位覆盖产业链多环节

10:59

国家体育总局:支持高校、家庭等多元主体参与竞技体育竞赛

10:58

保障旅客顺畅高效出行 《综合客运枢纽服务规范》国家标准发布

10:53

上海:强化天然气保供,至2030年储备能力达25天以上

10:49

上海市住房和城乡建设管理“十五五”规划:进一步扩大老旧小区改造覆盖面,实施老旧小区改造3000万—4000万平方米

10:49

上海市住房和城乡建设管理“十五五”规划:新增供应商品住房2500万—2800万平方米

10:46

南向资金净买入额达30亿港元

10:38

美元兑日元下跌0.4%至158.07

10:34

房地产板块异动拉升,信达地产2连板

10:19

高位人气股持续下挫,传智教育等多股跌停

10:19

围绕全民消防安全素质提升,七部门部署四项行动

10:17

煤炭板块表现活跃,郑州煤电涨停