谷歌DeepMind手语AI落地Pixel 11

2026.08.13 07:12
谷歌DeepMind正式发布SL2T手语翻译模型,首发搭载于Pixel 11系列手机,为7000万听障用户提供实时手语转文字功能。这是AI手语翻译首次以操作系统级产品形态落地,而非实验室demo。SL2T跳过传统gloss中间步骤,直接从人体几何坐标翻译,并采用隐私友好的骨架上传架构,为AI包容性设计树立了新标杆。

7000万听障人士等了十几年。AI手语翻译的demo视频不计其数,但没有一个真正走进过用户的手机。今天,这个局面被打破了。

谷歌DeepMind正式发布SL2T(sign-language-to-text)模型,一款多语言手语翻译模型,首发搭载于Pixel 11系列手机,内置于Gboard和Live Transcribe应用中。用户可以直接对着摄像头打手语,系统实时转化为文字,搜索网页、发消息、写邮件、甚至和Gemini对话,都不再需要打字。

这不是又一个实验室demo。这是AI手语翻译第一次以消费者产品的形态,真正进入用户手中。

从SignGemma到SL2T:一条从实验室到口袋的路线图

2025年5月,谷歌在I/O大会上宣布SignGemma,一个开源手语理解模型,定位是让开发者在此基础上构建。彼时,Sam Sepah等谷歌内部的听障员工在X平台上展示了初步效果,但距离成为普通用户能用的功能,还有一段路。

15个月后,SL2T来了。它不再是一个需要开发者自己部署的基础模型,而是直接嵌入Android最核心的两个应用:输入法Gboard和实时转录Live Transcribe,且完全免费。

一个听障用户打开Pixel 11手机,就能像听力健全用户用语音输入一样,对着摄像头打手语,文字自动出现在屏幕上。不需要装第三方App,不需要额外设备,不需要付费订阅。

过去十年,AI手语翻译领域的demo此起彼伏。Meta发布过How2Sign数据集,学术界推出了多款翻译模型,Signapse等创业公司也已在特定场景提供商业服务。但所有这些方案都有一个共性断点:它们都没有被深度集成到用户的日常操作系统中。

手语翻译有一个根本矛盾:它需要一个摄像头持续捕捉手势,而用户使用手机的大多数场景,走路、吃饭、在公共场合,并不适合架着手机拍摄。只有在用户本身就拿着手机、看着屏幕的场景下,手语输入才有实际意义。而这恰好是打字和语音输入已经在做的事。

SL2T选择了一个巧妙的产品切入点。它不做远距离翻译,而是做近距离输入。你本来就拿着手机、正在看屏幕的时候,把手语当作输入法来用。这个定位把手语AI从一个独立应用场景,压缩成了操作系统的一个输入方式。

技术突破:绕过中间商的直接翻译

SL2T最大的技术特色,在于它跳过了中间商。

此前几乎所有手语翻译系统都采用两阶段方法:先把手语视频翻译成gloss(一种标注符号),再把gloss转成自然语言文本。但gloss无法捕捉手语中的非手动标记,包括面部表情、头部动作、空间构建这些丰富的非线性信息。两阶段翻译本质上是在用有限词汇表翻译无限表达,信息损失严重。

SL2T选择了另一条路,直接从人体的几何坐标翻译成文本,跳过gloss步骤。这意味着模型可以学习手语的全部语义信号,包括那些无法被标注为gloss的表情和姿态。

谷歌DeepMind用超过10万小时的多语言手语数据训练了SL2T,其中约四分之一为美国手语。训练数据本身覆盖了50多种手语,为后续扩展奠定了基础。这也是为什么首发仅支持ASL到英语的翻译,但模型在架构上本身就是多语言的。

“Glosses fail to capture rich, non-linear aspects of sign languages such as non-manual markers and spatial constructions. Translating directly from landmarks removes artificial vocabulary limits and allows translation quality to scale directly with data.”
——Google DeepMind

隐私架构:把骨架送上云端

另一项值得关注的设计是隐私架构。SL2T并不直接处理原始视频。手机端先运行一个轻量化的姿态估计模型,将视频帧转化为一组几何坐标,相当于把人的手势骨架提取出来,只把这组坐标数据发送到谷歌服务器做翻译。

这意味着原始视频数据永远不会离开手机。即使网络传输被截获,攻击者看到的也只是一堆坐标点,无法还原为用户的影像。这个设计在听障场景中尤为重要,因为手语用户通过面部表情传达大量语义信息,如果直接上传视频,隐私风险极高。

免费,但为什么

谷歌DeepMind选择将SL2T完全免费提供,且不限于Pixel 11,更多设备即将到来。这个定价策略值得深思。

从商业角度看,SL2T的直接收入几乎为零。但它为Android生态建造了一个听障友好的护城河。在苹果尚未推出同类功能的情况下,Pixel 11成为听障用户的首选手机。同时,SL2T为Gemini打开了新的交互入口,用户可以通过手语向Gemini提问,这意味着Gemini的触达人群直接扩大了7000万,这恰恰是语音助手从未覆盖的增量市场。更深层的价值在于,10万小时训练数据只是起点,真实世界中数百万用户的手语数据,将让SL2T的翻译质量持续迭代。这是任何实验室demo都无法比拟的飞轮效应。

从为听障群体设计到与听障群体共建

SL2T的另一个关键差异,在于它的开发方式。

谷歌DeepMind组建了AI Sign Language Advisory Committee,成员包括听障组织代表和手语专家。谷歌内部的听障员工,如Sam Sepah,深度参与了产品设计和测试。团队还专门训练了单手打手语和左手打手语的识别能力。这些细节只有和真正的听障用户密切合作才会想到。

这是nothing about us without us的开发哲学。SL2T不是帮听障群体做的东西,而是和听障群体一起做的东西。

行业影响:一个转折点

SL2T的发布,是AI手语翻译从能不能做到什么时候好用的转折点。它给行业定下了一个新的标准:要做就做进操作系统,不要只发论文和demo。

对听障用户而言,这是一个里程碑。但同时也需要清醒认识到,SL2T目前仅支持ASL到英语。全球200多种手语中的绝大多数,仍然没有得到AI的支持。

对Signapse、Sorenson等手语AI创业公司而言,谷歌的免费策略既是压力,也是利好。谷歌证明了技术可行性和市场存在,这些公司可以专注于垂直场景,比如公共服务公告、企业培训、教育,来建立差异化。

SL2T现在只是第一步。谷歌已经明确表示,下一步将扩展更多手语、推出手语生成功能,并整合更前沿的AI能力。这一天到来时,数字世界的手语和口语之间的鸿沟,才真正开始收窄。

AI不能消除所有障碍。但至少,7000万人不再需要为了用手机,而放弃自己的母语。

作品声明:内容由AI生成