你有一张三年前的照片,想找出当时穿的那件外套,但不记得是哪天拍的。放在以前,你得翻遍整个相册。现在你只需要对 Gemini 说一句“帮我找到穿蓝色牛仔外套的照片”——它就能做到。不止如此,你还能让它把那件外套的背景 P 掉,把这张照片加入一个叫做“2023 年穿搭”的共享相册,再顺手把照片里那张演唱会海报上的日期存进日历。
这一切,不再需要动手点按一个按钮。
一张演唱会海报引发的自动化
2026 年 9 月 5 日,谷歌 Google Photos 负责人 Shimrit Ben-Yair 正式宣布:Gemini Spark 现已支持管理用户 Google Photos 照片库。用户可以直接通过自然语言指令,让 Gemini Spark 编辑图片、整理相册、根据精选照片自动创建共享相册,还可以识别演唱会宣传单等照片中的信息,将相关活动自动转换为日历预约。
谷歌官方给出了一段让人印象深刻的示例提示词:“找到上个月我们 Big Sur 公路旅行的前 10 张照片。优化日落镜头,把它们加入一个名为‘Coastal Drive 2026’的共享相册,然后把链接通过邮件发给妈妈。”来源:Google 官方支持论坛
这不仅仅是在 AI 里加个照片搜索功能。
Gemini Spark 是谷歌在今年 5 月 Google I/O 2026 上发布的旗舰级 AI Agent 产品,定位是“全天候运行的个人 AI 助手”。与传统聊天式 AI 不同,Spark 运行在 Google Cloud 虚拟机上,即便用户合上笔记本电脑,也能继续在后台执行任务。它通过 MCP 协议连接 30 多款应用,能主动监视信息、识别模式、执行多步骤工作流——而不是被动等待用户的下一条指令。
Spark 的订阅门槛不低。谷歌 AI 订阅目前分为三个层级:AI Plus(7.99 美元/月)、AI Pro(19.99 美元/月)和 AI Ultra(I/O 2025 定价 249.99 美元/月,I/O 2026 降至 199.99 美元/月)。此次 Google Photos 管理功能面向 AI Pro 和 Ultra 用户,目前仅限美国地区、仅支持英语。用户需要将 Google Photos 与 Gemini 关联,之后在 Gemini 应用顶部打开 Spark 功能,即可等待推送。
一个值得回味的细节是:谷歌早在 2024 年就开始测试 Ask Photos 功能——用自然语言搜索照片,比如“找一张有沙滩和狗的照片”。2026 年 3 月,谷歌还因为用户投诉 AI 搜索太慢、不够精准,被迫在搜索界面加了一个“切换回经典搜索”的按钮。从那时到现在,不过半年时间,谷歌已经从“帮你搜照片”进化到“帮你改照片、整理照片、安排行程”。
这种进化速度本身,就是一个信号。
从“搜照片”到“管照片”:AI 角色的质变
理解这次更新,不能只把它看作 Google Photos 多了一个功能。核心变化在于:AI 的角色从“搜索工具”变成了“个人数据管家”。
过去的 AI 图片功能,无论是谷歌的 Magic Editor、苹果的 Clean Up 工具还是 Adobe 的 Firefly,本质上都是“工具型 AI”——你告诉它做什么,它执行单一步骤。你可以让 AI 移除背景、消除路人、调整光线,但操作完,你的照片管理任务就结束了。
Gemini Spark + Google Photos 的突破在于“工作流”。它不止能编辑一张照片,还能根据你的指令执行一个完整的多步骤任务链:识别照片内容,提取关键信息,执行编辑,归类到相册,同步到日历,生成共享链接。这意味着 AI 的理解力从“像素层”跃升到了“语义层”——它读得懂照片里的信息,而不只是像素分布。
一个典型案例:演唱会海报识别。传统的 AI 图片识别能做到“这张图里有一张海报,海报上有文字”。但 Gemini Spark 能做到的是“这张海报上写着 2026 年 10 月 15 日在麦迪逊广场花园举办演唱会,创建一个日历事件,提醒我买票,把这张海报加入‘2026 演唱会’相册”。从识别到行动,一步到位。
谷歌还强调,所有编辑操作都会生成新的副本,原始照片不会被修改。隐私层面,用户可以在 Gemini 设置中随时断开 Photos 连接。
Gemini Spark 可以同时跨应用执行任务:从照片中提取文字写入 Docs,将截图中的收据信息导入 Sheets,再把整理好的相册通过 Gmail 分享——这些在一条提示词内即可完成。
竞争格局:谷歌的“回忆数据”护城河
自然语言驱动的照片管理,正在成为 AI 巨头们的新战场。
苹果在 WWDC 2026 上展示了更激进的 AI 照片编辑方向——iOS 27 中,用户可以用自然语言描述对照片的修改意图。但苹果的路线更偏“编辑”而非“管理”:更关注如何用 AI 改变照片内容,而非跨应用的异步工作流。
微软尚未在 Copilot 中推出类似的 Google Photos 级整合,其 Microsoft Photos + Copilot 组合已具备基本的自然语言搜索能力。但微软缺乏谷歌在“照片 + 日历 + 邮件 + 共享”生态链条上的完整度。
真正的差异化在于:谷歌拥有 Google Photos 这个全球月活用户约 15 亿的平台(Petapixel, 2025 年 5 月),加上 Gmail、Google Calendar、Google Drive 形成的数据闭环。这是苹果和微软短期内无法复制的优势——谷歌手中握着全球最大的个人照片库,15 亿用户的回忆资产。
更关键的是,Gemini 自身的用户规模正在快速追赶。据福布斯中国报道,Gemini 应用在 2026 年 8 月正式突破 10 亿月活用户,成为谷歌史上增长最快的产品。Google Photos 的 15 亿用户与 Gemini 的 10 亿用户形成的高价值交叉池,是谷歌布局“AI 管家”最核心的用户底座。
为什么只给 Pro 和 Ultra 用户?
谷歌把 Spark 的 Google Photos 功能限制在 AI Pro 和 Ultra 订阅上,不是一个随意的决定。
AI Pro 每月 19.99 美元,AI Ultra 每月 199.99 美元。对于一个定价如此之高的 AI 订阅来说,单纯的聊天功能已经不足以支撑用户的付费意愿。谷歌必须让订阅用户感受到“这笔钱花在了哪里”——能帮我管理最私密数据的 AI,比一个能写诗的 AI 更让人愿意付费。
让 Gemini 学会管理照片,本质上是让两个产品产生化学反应的催化剂:你在 Photos 里用得越顺手,就越离不开 Gemini;你越依赖 Gemini,就越不可能降级到免费版。这种“能力锁入”效应,比任何营销推广都更直接有效。
从商业模式角度看,AI Agent 正在从“算力付费”转向“能力付费”。用户不再只是为 Token 使用量买单,而是为 AI 能替他们少做多少事买单。Google Photos 整合是谷歌证明“Gemini 值得每月 20 美元”的关键一役。
技术前提:Gemini 3.5 Flash 的速度突破
这一功能能够落地的技术前提,是 Gemini 3.5 Flash 的推出。谷歌在 I/O 2026 上发布了该模型,称其生成输出 Token 的速度约为其他前沿模型的 4 倍,专为 AI Agent 和复杂工作流场景构建。
照片编辑和相册管理涉及多重能力:多模态理解(看懂图片内容)、推理(理解用户意图)、工具调用(执行编辑、创建事件)。这需要模型在多个维度同时保持高质量输出。Gemini 3.5 Flash 在速度上的突破,使得“实时响应 + 后台持续运行”的双轨工作流成为可能——用户发出指令后秒级反馈编辑结果,同时 Spark 在后台继续整理剩余照片。
这也是为何谷歌将 Spark 定位为“全天候运行”而非“实时对话”。前者意味着 AI 可以在你睡觉时整理完所有照片,后者只意味着 AI 在你说话时才有用。两种定位,本质上是两种产品哲学。
这意味着什么
谷歌正在做一件此前苹果和微软都没有做到的事:把 AI 从“你说一句,它动一下”的被动工具,升级为“你提一个需求,它全包”的主动管家。
这对行业意味着两件事。
第一,AI 竞争正在从“模型参数竞赛”转向“Agent 工作流竞赛”。谁能把更多的个人数据场景串联起来,谁就能在用户的生活中占据更大的入口。GPT-5 的参数是 10 万亿还是 20 万亿,用户不关心;但“帮我整理这个月拍的所有照片并分享给家人”能不能一次完成,用户非常关心。
第二,订阅制的商业模式正在从“算力付费”转向“能力付费”。用户不再只是为 Token 使用量买单,而是为 AI 能替他们减少多少工作量买单。Google Photos 整合是谷歌证明“Gemini 值得每月 20 美元”的关键一役。
对于直接竞争者而言,苹果拥有硬件生态和隐私信任的护城河,微软拥有企业数据和办公场景。但谷歌手中握着全球最大的个人照片库——15 亿用户的回忆资产。谁更擅长处理“人的记忆”,谁就更有可能在个人 AI 管家的战争中占得先机。
照片不会说话。但 AI 已经开始替它们说话了。






快报