Google 用一亿次下载量埋的伏笔,今天在嵌入层引爆了一场战争

2026.10.07 09:11
Google DeepMind 发布 EmbeddingGemma 2,一个 7.4 亿参数的开源多模态嵌入模型,使用 Apache 2.0 协议,将文本、代码、图像、音频和视频统一映射到 768 维向量空间,完整多模态权重仅占 567MB 活跃 RAM。这不仅是产品迭代,更是 Google 在嵌入层基础设施标准上发起的战略竞争——通过开源 + Android 生态集成,向闭源嵌入 API 模式发起侧翼包抄。

你可能没听过 EmbeddingGemma 这个名字。

但它的前身已经被下载了超过 2000 万次。整个 Gemma 家族累计下载量突破 10 亿次。而就在昨天,Google DeepMind 把这些数字背后的积累,变成了一个更锋利的东西——一个能同时理解文字、代码、图像、音频和视频,却能在你手机上运行的开放嵌入模型。

这不是一次简单的产品迭代。

从 2000 万次下载到全模态嵌入,Google 在下一盘什么棋?

2026 年 10 月 6 日,Google DeepMind 正式发布 EmbeddingGemma 2。这是一个 7.4 亿参数的多模态嵌入模型,采用 Apache 2.0 开源协议,从 Hugging Face 和 Kaggle 上即可下载。

嵌入模型是 AI 系统中最低调却最关键的基础设施。它负责将文字、图像、声音等信息转化为计算机能理解的向量——没有它,语义搜索、RAG(检索增强生成)、推荐系统都无法运转。第一代 EmbeddingGemma 自 2025 年发布以来,只在文本嵌入这一个赛道上跑,拿下了 2000 万次下载。第二代直接翻了四倍——代码、图像、音频、视频,五种模态全部映射到同一个 768 维向量空间。

具体参数值得细看。模型总参数量 7.4 亿,但模块化设计让它按需加载——纯文本只需激活 2.7 亿参数,加上视觉编码器的 1.7 亿和音频编码器的 3 亿,拼出全模态形态。嵌入向量可以通过 Matryoshka Representation Learning(MRL)从 768 维动态压缩到 128 维,存储空间最多缩减 6 倍。上下文窗口从第一代的 2048 token 扩大到 8192 token,一次推理可容纳 29 张图像、58 帧视频或 5.5 分钟的音频。

全部在本地设备上执行,数据不出手机。

在 Google 的 Pixel 11 Pro 上,这个模型完整多模态权重只占约 567MB 活跃 RAM,纯文本模式更低,仅 191MB。对于一部 12GB 甚至 16GB RAM 的旗舰手机来说,几乎不构成负担。

如果第一代 EmbeddingGemma 是在验证<q>轻量级嵌入</q>的市场假设,那么第二代以 Apache 2.0 + 全模态的组合杀入市场,则发出了一个更明确的信号:Google 不只想做模型层的玩家,它要拿下嵌入层的基础设施标准。

三点布局:Google 的<q>嵌入层三重奏</q>

回看 2026 年上半年 Google 在嵌入模型领域的动作,一条清晰的递进线浮现出来。

3 月,Google 发布 Gemini Embedding 2——闭源产品级多模态嵌入模型,面向云 API 调用场景。10 月,EmbeddingGemma 2 以开源 + 轻量级的姿态补上第二条腿。而在这之间,4 月发布的 Gemma 4 为这一代模型提供了底层架构。EmbeddingGemma 2 与 Gemma 4 共享 text tokeniser 和部分权重,这是它能在极小参数量下实现远超体量性能的底层原因。

三层布局各有所指:云上闭源(Gemini Embedding)打企业级 API 市场,开放轻量(EmbeddingGemma)围剿开发者生态,边缘集成(ML Kit)锁定 Android 入口。每层的目标用户、部署场景和商业模式截然不同,但共享同一个技术核心——统一嵌入空间。

这一套组合拳指向一个清晰的判断:Google 认为嵌入层将成为 AI 时代的核心基础设施,就像云计算时代的数据库。

为什么嵌入层值得重仓

这不是宏大叙事里的概念推导。全球向量数据库市场 2025 年的规模是 25.8 亿美元,预计到 2034 年增长到 179.1 亿美元,年复合增长率 24%——数据来自 Fortune Business Insights。嵌入模型是向量数据库上游的<q>发电厂</q>,没有高质量的嵌入,向量数据库就失去了存在的根基。

一个更关键的趋势在设备端。2025 年以来,旗舰手机标配神经网络处理器(NPU)已成为行业基准——苹果 A18/A19 Pro、高通骁龙 8 Elite、谷歌 Tensor G4/G5 全部内建专用 AI 加速单元。到 2026 年,<q>Gen AI 智能手机</q>不再是噱头,而是出货主力。当边缘端算力就绪,嵌入模型体量缩减到 567MB 同级,EmbeddingGemma 2 的发布时机精准得不像巧合。

ObjectBox 在 2026 年的行业分析报告中点明了这个转折:<q>设备终于有了足够的算力。</q>NPU 不再是差异化的卖点,而成了标配——它们恰恰擅长加速向量搜索所依赖的点积和矩阵运算。同时,嵌入模型变小了、变好了。EmbeddingGemma 和 Qwen3 Embedding 0.6B 已经在 MTEB 上达到可竞争水平,且只占用手机内存的零头。

<q>开放</q>才是最锋利的武器

EmbeddingGemma 2 选择 Apache 2.0 许可协议。这意味着它可以自由用于商业产品,没有版权顾虑,没有使用量限制。

这是一个经过计算的战略选择。目前嵌入模型市场正处在一个微妙的转折点:OpenAI 的 text-embedding-3-small 走闭源 API 路线,按 token 计费;Cohere 的 Embed 系列以企业级 SDK 售卖为主;Voyage AI 聚焦垂直场景。嵌入模型本身的核心壁垒不在模型能力——说句实在话,不同模型在 MTEB 分数上的差距普遍在毫厘之间——真正的壁垒在于生态绑定。

Google 做了两件事来打破这个壁垒。第一,将 EmbeddingGemma 2 集成到 ML Kit——Android 端的机器智能 SDK——这意味着全球数十亿 Android 设备将默认具备多模态嵌入能力,开发者不再需要考虑<q>选什么模型</q>的问题。第二,Apache 2.0 协议消除了企业的合规顾虑,下载即用,商业产品无附加条款。

这两招瞄准的不是<q>更好的模型</q>的竞争,而是<q>更低的上手门槛</q>的竞争。

当<q>免费 + 本地 + 系统级集成</q>的选项摆在面前时,一个很现实的问题就会浮现:为什么还要为云端嵌入 API 按 token 付费?

基准测试说了什么

在技术维度上,EmbeddingGemma 2 拿出了有说服力的数据。MTEB Code(代码检索基准)得分从第一代的 68.76 提升到 78.68,跃升了将近 10 分。对代码库索引、语义代码搜索和编程 Agent 场景来说,这个改善是显著的。Google 还声称,在图像、视频、文档和音频嵌入相关基准上,它在 10 亿参数以下的模型中达到了最佳水平,甚至在某些任务上超越了体量两倍于它的专用模型。

但一个细节值得注意:多语言文本性能与第一代基本持平。Google 的原话是<q>matches the strong multilingual text performance</q>。这意味着 EmbeddingGemma 2 的提升主要来自新引入的模态(代码、图像、音频、视频),而在它原本擅长的多语言文本领域,并没有显著突破。

这不一定是缺点。对于一款定位为通用多模态嵌入的开源模型来说,让文本能力维持在已有高水平、同时大幅扩展能力边界,是合理的资源分配策略。但这意味着在纯多语言文本检索场景里,它相比第一代或某些竞品并没有压倒性优势。

嵌入层的战争,第一枪是 Google 开的

嵌入层向来是 AI 产业链中最不受关注的部分——它的价值只有在检索质量下降时才会被感知。就像空气,平时没人觉得它重要,直到喘不上气。

Google 正在赌一件事:如果嵌入层最终会成为 AI 时代的底层标准,那么抢先定义这个标准的人,将获得远超嵌入模型本身收入的价值。

赌注的筹码有三:Gemma 家族的品牌信用(10 亿次下载量)、Android 生态的渠道优势(ML Kit 原生集成)、以及 Apache 2.0 的开源战略(将采用门槛降至零)。这三者中的任意单一优势都不足以锁定胜局,但三者叠加就构成了一道极难复制的竞争壁垒。

对开发者来说,这意味着嵌入模型的选择将从<q>选性能最好的</q>变成<q>选生态集成最顺的</q>。如果应用跑在 Android 上,EmbeddingGemma 2 几乎就是默认选项。如果应用需要全本地部署,它是目前唯一一个在 567MB 内做到四模态统一嵌入的开源选择。

对嵌入模型 API 供应商来说,这是最不想看到的消息。当一个主流平台在系统层提供了质量足够好的免费本地替代品,按 token 付费的模式还能撑多久?

而当 ML Kit 全面集成 EmbeddingGemma 2、数十亿 Android 设备在系统层自带多模态嵌入能力的那一天到来,问出这个问题的开发者,恐怕会从一个群体变成一种常态。

嵌入层的战争,第一枪是 Google 开的。它选的武器不是最重的,却是离战场最近的。

作品声明:内容由AI生成