一个独立游戏开发者发现,自己写在私人 Google Docs 里、从未公开过的未来版本角色名,被谷歌 Gemini 准确“说”了出来。这篇文档从未分享、从未上传、从未被任何人看到过。谷歌的回应是:我们没有用你的私人文档训练模型。
但问题恰恰在于,Gemini 到底是怎么知道的?
一纸私人文档,AI 如何得知?
2026年8月7日,独立游戏工作室 Klub Kofta Studio 的 solo 开发者发帖称,其塔防游戏《Operation Octo》的未公开角色名“Vantage Tripod”,被谷歌 AI 搜索功能(由 Gemini 驱动)准确提及。而该角色名仅存在于开发者个人的私有 Google Docs 文档中。它既未嵌入游戏文件、未上传 Steam、未公开分享,也从未被输入给 Gemini。
事情经过是这样的:一位玩家在《Operation Octo》的 Discord 服务器里,出于好奇向谷歌的 AI 搜索功能提问关于游戏的各种问题。有些回答明显错误,但另一些却精准得令人不安。开发者让玩家进一步追问未公开内容,Gemini 直接吐出了“Vantage Tripod”这个精确到字母的角色名。
更令人毛骨悚然的是,社区此前对这只生物的唯一认知,是开发者在一次 Gartic Phone 游戏中随手画出的草稿,被玩家们戏称为“Tripod Fish”(三脚鱼)。而“Vantage Tripod”这个正式名称从未在任何公开场合出现过。开发者还表示,Gemini 对其他仅存在于开发笔记中的未公开机制也做出了准确描述。
我的游戏规模不大,没有那么多噪音来混淆谷歌的 AI,所以它反而给出了准确得可怕的真实泄露。
谷歌的回应来自 Polygon 的采访。一位代表明确表示:“谷歌不会扫描你的私人 Workspace 内容(包括 Drive 和 Docs)来训练我们的基础 AI 模型(包括 Gemini)。”谷歌同时指出,如果文档链接被公开分享并被搜索引擎爬虫索引,则可能被检索到,用户可以通过分享设置完全控制自己的文档权限。
但这个回应并没有解答最关键的问题:如果这篇文档从未被分享过,Gemini 是怎么知道的?
技术上的正确,体验上的矛盾
谷歌的回应在技术层面是精确的。它确实没有用私人 Docs 内容训练 Gemini 的基础模型。但用“没有训练”来回应“为何泄露”,本质上是在偷换概念。
2026年4月,谷歌发布了 Workspace Intelligence,一个深度嵌入 Docs、Sheets、Slides 的 AI 系统。根据官方博客,Workspace Intelligence 能够“对 Workspace 应用(如 Docs、Slides、Gmail)中的复杂语义关系进行内在理解”,并“结合谷歌级搜索和索引质量与 Gemini 的高级推理能力”。Gemini 在 Workspace 中的能力已经进化到可以“根据你的业务数据生成信息图”、“阅读你的文档内容并基于评论编辑文档”。这些功能需要读取用户文档内容才能运行。
Ars Technica 在2026年4月的调查报道中揭示了一组矛盾:谷歌声称“不会用你的 Workspace 内容训练模型”,但 Gemini 可以接入 Workspace 工具读取你的数据,其输入和输出本身可能被用于模型改进。换句话说,谷歌的隐私承诺精确到每一个字,但组合在一起,用户的实际体验就是“AI 知道了我写在私人文档里的东西”。
这种“技术上的精确”与“体验上的矛盾”之间的鸿沟,正是这次事件最值得追问的地方。
模式匹配还是数据泄露,哪个更可怕?
Cybernews 的分析提出了一个细思极恐的问题:答案可能不是“训练数据泄露”那么简单。
一个可能性是:Gemini 通过公开信息进行了推理。社区中流传着“Tripod Fish”的称呼和画作,AI 可能将“Tripod”与“Vantage”两个概念关联起来,再加上对游戏风格的了解,拼凑出了这个名称。如果这个解释成立,那意味着 AI 的推理能力已经强到能“猜出”一个从未公开的专有名词,这本身就是一件值得警惕的事。
但另一个可能性更加令人不安:某个中间环节(也许是一次意外分享、一个第三方插件、一个协作记录)让文档内容暴露在了 Gemini 可触及的范围内。开发者坚称文档从未分享,但谷歌的回应暗示了“如果链接被公开并被爬虫索引”的可能性。问题是,如果连开发者自己都不知道文档何时被泄露,普通用户又该如何保护自己的数据?
Cybernews 对此的评论一针见血:“模式匹配可能造成和泄露一样的损害。”
这不是第一次了
大模型泄露隐私从来不是孤例。
2023年3月,ChatGPT 因 Redis 缓存库的缺陷,导致部分用户能看到其他用户的聊天标题,甚至少量 Plus 订阅者的账单信息。OpenAI 被迫下线服务修复漏洞。
同年9月,谷歌旗下 Bard(Gemini 前身)的共享聊天链接被搜索引擎意外收录,导致用户与 AI 的对话内容可以被公开检索到。谷歌搜索公关团队当时在 X(原 Twitter)上承认了这一问题,并表示“正在阻止这些页面被索引”。
2025年,部分 ChatGPT 用户的敏感对话内容被发现持续泄露至搜索引擎。同年,安全研究团队 Truffle Security 在扫描 DeepSeek 训练数据时发现了约 12,000 个仍可鉴权的 API 密钥和密码。
2025年9月发布的国内首个大模型安全众测结果显示,大模型普遍存在隐私泄露风险,共发现安全漏洞 281 个。据不完全统计,国内外大模型关于隐私泄露的事件已有 100 多起。
IBM 2025 年数据泄露成本报告显示,全球平均泄露成本为 444 万美元。而在涉及 AI 模型的泄露事件中,97% 的组织缺乏适当的 AI 访问控制。
信任,才是 AI 时代最稀缺的资源
这次事件表面上是“AI 猜中了一个游戏角色名”,但背后揭示的是整个 AI 产业的核心矛盾:当 AI 被深度嵌入我们的数据基础设施,用户对“私有”和“公开”的理解,与 AI 系统的实际运作方式之间存在巨大的认知鸿沟。
谷歌的合规团队可以把隐私政策写得滴水不漏,但用户的直观感受是“我的私人文档被 AI 读取了”。这种认知差距一旦积累到临界点,就会引发信任危机。而信任危机,对任何依赖用户数据的 AI 公司来说,都是比技术瓶颈更致命的威胁。
Gemini 是怎么知道“Vantage Tripod”这个名字的,或许永远不会有确切答案。但一个更值得追问的问题是:当你存放在云端的“私人”数据,连你自己都不知道它是否还私人时,信任的边界又该划在哪里?






快报