2026年7月,Android Authority 的开发者拆解了 Gboard 最新测试版(v17.8.3.939743344-beta)的 APK 代码,发现了一个从未见过的功能入口:Sign-to-Text。这个功能的名字听起来像是一个普通的无障碍更新,但它的实现方式暴露了谷歌更大的战略意图。当全世界最流行的手机键盘开始调用摄像头、理解手势、在云端解码一门语言的语法和语义时,Gboard 就不再只是一个打字工具了。
Gboard 代码里藏了一个手语翻译器
2026年7月17日,Android Authority 发布独家报告,在谷歌 Gboard 安卓测试版中发现了手语转文字功能的代码。该功能利用手机前置摄像头实时捕捉用户的手语动作,在设备本地完成视频帧处理,提取手势骨架数据,然后将抽象化的手势信息上传至云端进行语义识别,识别完成后立即从服务器删除。用户的原始视频不会离开手机。
根据代码中提取的提示文本,该功能会引导用户面向摄像头、确保光线充足,并支持消息输入、邮件撰写和网页搜索等系统键盘调用场景。首发预计支持美国手语(ASL),谷歌尚未公布是否会扩展至英国手语(BSL)、中国手语(CSL)等其他语言变体,也没有给出正式上线时间表。
这并非谷歌在手语 AI 领域的首次亮相。2025年5月的 Google I/O 大会上,谷歌 DeepMind 发布了 SignGemma,号称当时最先进的手语理解模型,专为端侧设备设计,可实时将手语翻译为文字或合成语音。SignGemma 基于 Gemma 开源模型家族,谷歌承诺将在2025年第四季度开放模型权重。但截至2026年7月,SignGemma 仍未在 Google AI Studio 或 Vertex AI 中正式上线,开发者社区中已有多人在论坛询问进展。
与此同时,谷歌研究团队与 Deaf 社区合作,在 CVPR 2025 上发表了 FSboard 项目。这是一个从147位聋人手语使用者采集的、超过300万字符和250小时的 ASL 手指拼写识别数据集。该数据集使用普通的 Pixel 4A 前置摄像头而非科研级设备拍摄,训练出的基线模型在未见过的测试短语和手语者上实现了11.1%的字符错误率。虽然目前没有直接证据表明 FSboard 与 Gboard 的产品路线图存在关联,但这些研究积累为谷歌在手语识别领域构建了扎实的技术储备。
这些拼图正在被一块块拼合起来。FSboard 提供了数据方法论,SignGemma 提供了模型能力,而 Gboard 提供了全球最大的分发渠道。该应用在 Google Play 上的累计下载量已超过100亿次。
当键盘开始看这个世界
为什么是 Gboard?
理解这个动作的战略意义,需要先看清 Gboard 在谷歌产品矩阵中的位置。
Gboard 是目前全球安装量最大的手机键盘应用,2025年2月突破100亿次下载。它从最初的纯键盘输入,逐步加入了滑动输入、语音输入、多语言翻译、剪贴板管理、GIF 搜索等功能。每一次功能扩展,都在重新定义键盘这个手机最底层、最日常的交互界面。
但手语识别与以往所有功能有本质区别。它调用的是摄像头,而不是触摸屏或麦克风。这意味着谷歌正在将 Gboard 的输入维度从手指触控和语音扩展到视觉。键盘变成了一个持续运行的视觉 AI 终端。
对于一个拥有100亿次下载量的系统级应用来说,这是一次静默升级。用户不需要额外下载任何应用,不需要学习新操作,打开 Gboard 就能用摄像头完成输入。这种分发效率,是任何独立手语翻译 App 都无法企及的。
技术上的虎口夺食
手语识别的技术难度常被低估。与语音识别不同,手语是一种三维的、多模态的语言。它不仅涉及手形和手势的运动轨迹,还包括面部表情、头部姿态、身体朝向等非手控信号。同一手势在不同的面部表情下可能表达完全相反的含义。ASL 本身约有6000个手势常用词,加上语法结构中的空间关系和时序变化,对计算机视觉系统提出了极高的要求。
谷歌的应对策略是本地加云端混合架构。在设备端用 MediaPipe 进行实时手部关键点追踪(21个手部关键点,每秒30帧以上,即便在移动端 GPU 上也能保持实时性能),提取手势骨架后仅将抽象化数据上传至云端,由 SignGemma 或类似模型完成语义解析。这种架构既缓解了端侧算力不足的问题,也在隐私层面做了切割。用户的原始视频不会离开手机。
但这也意味着功能的使用体验高度依赖网络质量。在信号不佳的地区,手语转文字可能出现延迟或中断。而这恰恰是手语使用者最需要无障碍工具的场景。谷歌尚未公布离线模式的时间表,也没有说明哪些型号的手机能够支持端侧实时处理。
300种手语,谷歌只选了一个起点
全球约7000万聋人分布在世界各地,使用着约300种不同的手语。ASL 虽然在美国和加拿大被广泛使用,但它只是庞大拼图中的一块。英国手语(BSL)的语法结构与 ASL 完全不同,中国手语(CSL)更是在词汇和表达方式上自成体系。
谷歌选择 ASL 为首发语言是合理的商业决策。ASL 的研究资源最丰富、数据集最完善、社区数字化程度最高。但这也意味着,如果谷歌不能快速扩展至更多手语,这一功能在全球范围内的实际影响力将大打折扣。对于中国、印度、东南亚等聋人人口密集的地区,ASL 并不适用,谷歌需要面对本地化的双重挑战,语言差异和合规门槛只是其中最先浮出水面的两个。
苹果和 Meta 在做什么
谷歌不是唯一在手语识别上押注的科技巨头,但它的切入路径最为独特。
苹果一直在 iOS 和 Apple Watch 上深耕辅助功能,但重点是听力辅助方向。Live Listen、Made for iPhone 助听器、Live Captions 实时字幕等工具的持续迭代,说明苹果选择的是增强听力而非翻译手语的技术路线。FaceTime 虽然支持高质量视频通话以适应手语沟通,但苹果并没有推出独立的手语识别翻译功能。
Meta 在 Reality Labs 和 Ray-Ban Meta 智能眼镜上探索手势交互,但聚焦于手势控制界面(捏合、滑动等),而非手势语言翻译。这是两个完全不同的技术方向。Ray-Ban Meta 智能眼镜已经支持实时语音翻译,但手语翻译尚未进入产品路线图。
谷歌的独特优势在于它拥有 Gboard 这个已经被数亿用户日常使用的系统级入口,以及开源模型(SignGemma 基于 Gemma 系列)来吸引开发者生态。对手想要复制同样的分发能力,要么需要打入系统键盘层,要么需要建立全新的硬件入口,短期内都难以匹敌。
键盘之后,摄像头之后
如果将手语识别放在谷歌的 AI 战略版图中审视,它的意义可能远超无障碍本身。
谷歌正在将 Gboard 从一个文本输入工具改造为一个多模态输入平台。语音输入是第一条非触控输入通道,手语识别是第二条。但摄像头这条通道的能力远不止手语。一旦 Gboard 获得了调用摄像头和实时视觉理解的权限和能力,它理论上可以做更多事情:识别物体、翻译菜单、阅读文档、识别表情。这正是 Gemini 多模态模型最擅长的领域。
从这个角度看,手语识别是谷歌为 Gboard 摄像头模式铺路的第一块砖。它是一个天然的、不可反驳的入口。没有人会反对一个帮助听障人士沟通的功能。但一旦摄像头权限和视觉 AI 管道在系统键盘层面建立起来,下一步扩展的想象空间就完全打开了。
谁会赢,谁在危险
对于全球超过7000万聋人和手语使用者来说,Gboard 的 Sign-to-Text 即使仅支持 ASL,也是一个里程碑式的进步。它意味着手语使用者可以用自己的第一语言直接输入文字,而不需要先学会打字或依赖语音转文字。这可能是自短信发明以来,聋人群体在数字沟通领域最重要的一次基础设施升级。
但谷歌的算盘显然不止于此。Gboard 手语识别是键盘、摄像头和 AI 三位一体的首次合体,它标志着移动输入从触控和语音正式进入视觉时代。当 Gboard 学会看之后,它就不再只是一个键盘。它是谷歌在移动端部署多模态 AI 的桥头堡。
危险的是那些仍然把键盘定义为九宫格或全键盘的竞争对手,以及那些认为 AI 交互只需要语音输入就够了的产品思路。输入方式的变革从不温和。从物理键盘到触屏,从触屏到语音,每一次转换都淘汰了一批公司。而这一次,谷歌选择在 Gboard 里藏了一颗摄像头。
等它正式上线的时候,你会发现,那个在屏幕底部弹出的小键盘,已经不再是你认识的那个键盘了。






快报