Google做了20年翻译,刚刚承认翻译远远不够

2026.09.16 07:15
Google近日发布了一篇题为"AI for everyone in every language"的博文,正式宣告从"翻译文本"向"理解语言"的范式转向。文章披露了Gemini 3.5 Live Translate覆盖70种语言、2000多个语言对的技术突破,以及"1,000种语言计划"背后的跨语言迁移学习策略。核心判断是:当AI不再把语言当作需要清洗的文本数据,而是当作包含情感、节奏和文化语境的活的存在,传统翻译行业的根基可能被彻底重构。

2006年,Google Translate上线。目标很朴素:打破语言之间的墙壁。20年后,Google的产品每天处理超过一万亿个单词,覆盖300多种语言、70多亿人口——相当于全球86%的人。但就在这样一个里程碑时刻,Google却说:翻译文本,远远不够。

“翻译正在剥离人类交流中最丰富的部分:语调、节奏、情感和语境。”Google高级副总裁James Manyika在2026年9月的最新博文中坦言。

这句话从一个做了20年翻译的公司嘴里说出来,本身就是一个信号。Google正在对自己过去的范式,发起一场“内部革命”。

从流水线到原生理解

过去几年,主流的语音AI遵循一条僵化的流水线:将音频转录成文本,处理文本,再将结果合成回音频。这条路线技术上成熟,但Google发现它有致命缺陷——它过滤掉了语言中“人”的部分。

“人们说话时并不会使用完美的、语法整洁的句子。”Manyika写道。“我们会笑、会重叠、会犹豫,会在同一句话里混用多种语言,就像我们说Spanglish或Hinglish那样。”

为了捕捉这种真实交流的质感,Google同时做了两件事。

第一件是产品层面的突破。今年6月发布的Gemini 3.5 Live Translate,能够实时进行语音到语音的翻译,覆盖70种语言、2000多个语言对。它不是那种“你说一句它翻一句”的笨重工具。它能自动检测源语言,在说话的同时连续生成译文,延迟控制在几秒之内,甚至保留了说话人的语调、节奏和音高。东南亚打车巨头Grab已经在测试这个模型,用于司机和乘客之间的实时沟通。仅Grab一个平台,每月就有超过1000万通语音电话需要跨语言交流。

第二件是Gemini 3.5 Transcribe,Google“有史以来最精确的语音转文字模型”。它驱动了Android Gboard上的Rambler功能:自动去除口头禅、修正语法和标点、支持语音指令编辑和改写、在不同语言之间无缝切换。它不是在“听写”,而是在“理解”。

但真正勾勒Google野心的,是一个更深远的故事。

300种语言之后,还有数千个盲区

从表面看,300种语言、86%的人口覆盖是一个了不起的数字。但Google想说的是,技术一直只服务于少数强势语言。

全球现存数千种语言。一个残酷的现实是,绝大多数语言在互联网上几乎没有存在感,也从未被任何AI系统认真对待过。

这就是Google“1,000种语言计划”的出发点。早在2022年11月,Google就宣布了这个目标:建立一个能支持全球最常用的1,000种语言的AI模型。选择“1,000种”这个数字是刻意的。它意味着Google不满足于服务庞大的主流群体,而是要把那些长期被数字世界遗忘的语言也拉进来。

但问题来了:另外700种语言的数据从哪里来?

跨语言迁移学习:用“富”养“穷”

Google的答案是跨语言迁移学习——一种让模型把在数据丰富的语言如英语、中文中学到的模式“转移”到数据极度匮乏的语言上的技术。

支撑这个计划的核心是Universal Speech Model(USM),一个拥有20亿参数、在1200万小时音频上训练的语音模型。1200万小时是什么概念?如果一个人24小时不间断地听,需要将近1370年才能听完。这个模型第一次让Google实现了对300多种语言的语音识别,包括阿萨姆语、阿塞拜疆语这些在传统AI系统中几乎不存在的语言。

USM的训练分三步:自监督学习先用大规模无标签音频“自学”语音的通用模式,然后通过多目标预训练将文本数据也纳入学习,最后针对具体任务做微调。关键在第一步。因为自监督学习不依赖人工标注,Google可以用任何语言的原始音频进行预训练,再用少量标注数据——甚至只有几个小时——就能让模型学会理解一种新语言。这就像让一个已经学会100种语言的人去学第101种,他不需要从头开始。

这不是理论意义上的进步。在印度,Google与印度科学理工学院合作启动了Vani项目,专注于印度本土语言。印度有超过22种官方语言、数百种方言,其中很多在Google Translate上都不存在。Vani项目的目标,就是通过与当地社区合作采集语音数据,逐步将这些语言带入数字世界。

这种“跨语言迁移”的手法,本质上是把AI的“富足”转化为“包容”。当大多数AI公司还在争夺英语和中文训练数据时,Google选择了一条更累但更公平的路。

从文本回到声音:为什么“转文字”本身就是一个错误

如果说“1,000种语言计划”解决的是广度问题,那么Google从文本向原生音频处理的转变,解决的则是深度问题。

传统的语音识别本质上是在“把声音压平为文字”。无论说话人用什么语调、带什么情绪、混用了什么语言,系统只做一件事:输出一行干净的文本。这行文本里有所有的“信息”,但所有的“温度”都蒸发了。

Google的转变在于,它不再把音频当作文本的载体,而是把音频本身当作信息。

Gemini 3.5 Live Translate的核心技术突破不在于它翻译得有多快,而在于它翻译的同时保留了语调、节奏和音高。当你说一句西班牙语时,它翻译成英语的不仅是词汇,还有你说话的情绪和节奏。你不是在和一台机器对话,而是在和一个能“听懂你”的系统交流。

更重要的是,这个模型能处理多语言输入。在现实世界中,人们经常在同一个句子中混用两三种语言——“明天我们meet一下,讨论一下roadmap”。传统的翻译系统面对这种code-switching往往会崩溃。而Gemini 3.5 Live Translate能自动检测这种混合,进行自然翻译。

“我们正在超越传统的文本翻译,构建能理解世界真实、生动语言的模型,正如它们被表达的那样。”Google博文的标题,也是这次范式转向的最好注解。

谁会受益,谁会受伤

Google在语言AI上的两个动作——扩大语言覆盖面和深化语音理解——将从根本上改变全球内容的可访问性格局。

首先,这是对“AI普惠”承诺的一次实测。据福布斯2026年2月报道,全球34亿人没有移动互联网接入。这个数字对应一整片被数字世界遗忘的人群。Google不仅在技术上追求更广的语言覆盖,还在产品层面做了离线功能适配。在肯尼亚、印度、巴西这些网络不稳定的地区,用户可以在没有网络的情况下使用翻译功能。

其次,这对东南亚、非洲、南亚多语言市场的数字经济是一个催化剂。Grab的测试展示了一个直接场景:当司机和乘客能用自己的语言实时交流,使用体验和服务效率都会发生质变。更深层的影响是,它保护了多语言使用者的文化身份。你不必放弃母语去适应互联网,而是让互联网来适应你。

但硬币也有背面。Google的精准翻译能力,意味着AI可以生成超级逼真的、保留说话人语调的跨语言语音。尽管Google使用了SynthID给所有AI生成的音频添加了不可感知的数字水印,但技术对抗从来都是一场军备竞赛。当AI能完美模仿一个政治人物的语调,并用另一种语言说出他们从未说过的话,这就是deepfake的2.0版本。

赢家是那些语言资源匮乏的社区,他们终于开始被数字基础设施认真对待。赢家也是Google自己。在一个AI竞争日趋同质化的时代,语言可能是最具护城河价值的差异化能力。OpenAI能做出强大的推理模型,但它在全球语言覆盖上的积累远不如Google在翻译业务上20年的沉淀。

危险的是传统的人工翻译和本地化行业。当实时语音翻译的准确率持续逼近人类水平,并且价格无限趋近于零,大量商业翻译、会议口译、字幕制作的生存空间将被大幅挤压。

“翻译”这个词,本意是把一种语言转换为另一种语言。但Google正在做的,已经不是翻译了。它在教AI听懂语言背后的那个人。

你不需要用完美的句子和AI对话。你可以结巴,可以笑,可以中英混杂,可以用只有几百万人使用的方言。问题不再是AI能不能理解你,而是AI愿不愿意接受你最原始的样子。

Google的答案只有一个字:愿意。

作品声明:内容由AI生成