当 OpenAI 的 GPT-4o Realtime API 还在用 token 计费、每秒钟都在积累成本的时候,英伟达做了一件截然不同的事。他们把整个语音对话模型打包成 11B 参数的开源权重,挂到了 Hugging Face 上。
没有发布会,没有新闻稿,没有推文预告。8 月 3 日,模型卡悄然上线。但在开源语音 AI 的世界里,这几乎是震级最大的一次地震。
一个“静默”开源模型,凭什么震动行业
NVIDIA NemotronLabs VoiceChat 11B 是一个 11B 参数的全双工(full-duplex)端到端语音模型,输入 16 kHz 音频,输出 22.05 kHz 智能体语音。几个数字,足以让行业侧目。
轮换延迟(Smooth Turn-Taking Latency)仅 448 毫秒,打断响应(User Interruption Latency)480 毫秒且 TOR 评分满分 1.0。训练数据约 55 万小时音频,涵盖真实语音(Fisher、LibriVox、LibriTTS、VCTK)和合成语音(基于 Nemotron 5.5、Ultrachat、PromptTTS 等文本语料生成)。更重要的是,它是首个支持实时工具调用的开源全双工语音模型,配备独立的工具调用输出通道。
人类自然对话的停顿间隔大约在 200 到 600 毫秒之间。448 毫秒的轮换延迟,已经摸到了“像真人一样说话”的门槛。
而且这是一个开源权重的模型。不是 API,不是封闭服务,而是可以下载到本地 GPU 的模型权重,不过许可证限制为“研究专用”(OpenMDW v1.1)。
技术拆解:它不是“三个模型拼在一起”
传统语音 AI 系统走的是典型的流水线架构:ASR(语音识别)接 LLM(语言理解)再接 TTS(语音合成)。每一步都需要单独调用一个模型,三次推理、三次延迟,每轮对话累积数百毫秒的额外开销。
VoiceChat 11B 选择了完全不同的路线。
它的架构是一体化的。Fast Conformer 语音编码器(来自 Nemotron-Speech-Streaming-En-0.6b)持续编码 16 kHz 的输入音频流,将音频信号转化为 token;这些 token 被送入 Nemotron Nano v2 9B LLM 骨干网络(混合 Mamba/Transformer 架构),预测文本 token;然后通过 NVIDIA TTS 解码器与音频编解码器,输出 22.05 kHz 的智能体语音。
整套流程在一个统一的流式推理过程中完成,省去了模型之间的序列化开销。英伟达使用 vLLM 推理引擎,测试硬件为 H100,支持从 A100 到 B200 的全系 GPU。
但架构中最大胆的设计,是独立的工具调用输出通道。当一个语音对话中,AI 需要查询数据库、调用 API 或执行计算时,VoiceChat 会生成两路输出:一路是自然语音继续对话,另一路是工具调用脚本。在工具执行的间隙,模型会播放自定义“等待音”,避免死寂。行业术语里叫“no dead air”。
基准测试:开源模型中的佼佼者
在 VoiceBench 上,VoiceChat 11B 在开源全双工模型中排名第二;在 Full-Duplex-Bench 1.0 上同样排名第二。
在 AU Harness BFCL-v3 口语工具调用测试中,简单工具调用准确率 58.5%,多工具调用 62.5%,并行工具调用 42.5%,并行多工具 27.5%,无关性判断 89.6%,平均 56.1%。在 Full-Duplex-Bench v3 上,工具选择准确率 82.5%,参数精度 44.2%,pass@1 仅 33%。
工具调用在简单场景下表现不错,但复杂并行场景下准确率骤降。参数精度 44.2%、pass@1 仅 33%,意味着模型频繁从用户语音中提取错误参数值。这是端到端语音模型在工具调用领域的共同难题,VoiceChat 只是第一个迈过这道门槛的开源模型,远非完美。
行业格局:英伟达为什么“静默”发布
对标谁
当前语音 AI 市场被两大阵营分割。封闭阵营以 OpenAI GPT-4o Realtime API(原生语音到语音,支持函数调用,按 token 计费)、Google Gemini 语音模式、Anthropic 的语音能力为代表。这些服务延迟低、质量高,但成本随使用量线性增长,数据必须在云端处理。
开源阵营此前主要由流水线方案主导(Whisper 加任意 LLM 加 TTS)。真正的端到端全双工开源模型寥寥无几。SALM-Duplex、Audio Flamingo 3 等是技术先驱,但缺乏工具调用能力,或模型规模不友好。
VoiceChat 11B 填补了一个关键空白。它是第一个将全双工对话、低延迟和工具调用三者打包的开源模型。
独立分析机构 Artificial Analysis 使用双轴基准(Full Duplex Bench 加 Big Bench Audio)评估后发现,VoiceChat 是唯一一个同时在对话动态(77.8%)和语音推理(29.2%)两条轴上进入帕累托前沿的开源模型。但开源与封闭模型之间的差距仍然巨大:Step-Audio R1.1 和 GPT-4o Realtime 的语音推理得分在 87% 到 96% 之间,而 VoiceChat 仅为 29.2%。
3:1 到 4:1 的差距,意味着开源全双工语音模型虽然实现了“从 0 到 1”的突破,但“从 1 到 100”还有很长的路要走。
为什么静默
英伟达的“静默发布”策略值得玩味。这不是英伟达第一次用 Hugging Face 悄无声息地释放开源模型,此前 Nemotron 系列多个模型都采用了类似做法。但这次不同。
原因之一是许可证限制。OpenMDW v1.1 明确标注“仅供研究使用”。这意味着英伟达不能像推广商业产品那样高调宣传,否则会在法律合规上自相矛盾。一个“研究专用”的模型,用发布会和新闻稿去推广,显然是错位的。
更深层的原因在于生态杠杆策略。英伟达真正的商业模式从来不是卖模型,而是卖 GPU。一个需要 80GB VRAM(H100 起步)的语音模型,如果被开发者社区广泛采用,就是对 H100/B200 等推理芯片的直接需求拉动。让模型在 Hugging Face 上“自然发酵”,比花大价钱做营销更有效。
产品成熟度也不容忽视。从 benchmark 数据来看,VoiceChat 在复杂工具调用场景下的准确率仍然较低。参数精度 44.2% 意味着开发者无法放心地将它部署到生产环境。低调试水,避免过高期待,是务实的选择。值得注意的是,英伟达开发者博客中提到了一个“Nemotron 3 VoiceChat”的 12B 版本,而 Hugging Face 上的版本是 11B,两者之间存在版本差异,进一步说明该模型仍在快速迭代中。
开发者视角:成本与门槛
“开源免费”是一个总被误解的表述。VoiceChat 11B 的权重下载成本为零,但运行成本是另一回事。英伟达官方推荐的最小配置是 80GB VRAM 的 GPU,在 H100 上测试。按当前云市场价格,H100 按需实例约 2 到 3 美元每小时,持续运行一个月约 1,500 到 2,200 美元,这还不包括应用开发、运维和并发扩展的成本。
相比之下,OpenAI Realtime API 按 token 计费,对中小规模应用来说门槛更低。但“本地部署”的吸引力在于数据不出域、可定制、无按量计费的压力。对金融、医疗、国防等对数据隐私要求极高的行业来说,这可能是天平的倾斜点。
英伟达还列出了多项硬约束:每会话最多 5 个工具,模型无法可靠地同时调用多个工具,用户不能在工具执行期间打断智能体,工具响应必须为 ASCII 且 TTS 友好。此外,模型音频上下文窗口仅约两分钟,不支持 backchanneling(即 AI 在听用户说话时发出“嗯”“对”等反馈信号)。这些限制意味着 VoiceChat 11B 当前更适合研究评估和原型验证,而非生产级部署。
结语
英伟达 NemotronLabs VoiceChat 11B 的发布,是开源语音 AI 领域的一个里程碑。它证明了全双工语音交互加实时工具调用不再是封闭 API 的专利,而是可以被下载、研究、改进的开放技术。
但“研究专用”的许可证、44.2% 的参数精度和单条 80GB VRAM 的门槛,意味着它还不是一个“可用”的产品。开源语音 AI 的“ChatGPT 时刻”还没有到来,甚至可能还需要几个迭代版本。
不过,一个先行者已经迈出了第一步。更关键的是,它来自英伟达。这家公司手里握着全球最多的 AI 算力,也最清楚下一步该往哪走。
语音 AI 的“安卓时刻”可能正在路上,但英伟达这把钥匙,只开了实验室的门,还没打开生产环境的那扇。






快报