Gemini 3.5 Pro闪现30分钟,谷歌的焦虑藏不住了

2026.07.31 16:03
2026年7月31日,谷歌Gemini 3.5 Pro模型在Arena平台短暂上线约30分钟后被撤下,距5月19日谷歌承诺的“6月发布”已过去73天。这场迟到的发布会以一次“闪现”收场,背后是编码能力未达标、核心人才出走、组织协同低效三重困境。当Anthropic和OpenAI如期发布旗舰产品时,谷歌的旗舰模型还在测试中。

73天前,谷歌CEO Sundar Pichai站在Google I/O的舞台上,对着满场开发者轻描淡写地说了一句“give us until next month”。台下没有掌声,只有一阵清晰的嘘声。那款被反复提及的模型叫Gemini 3.5 Pro。

73天后的2026年7月31日,这款模型终于“现身”了。在AI评测平台Arena上,它上线了大约30分钟,然后被迅速撤下。多位X平台用户截图为证,其中一位名叫Harshith的用户只来得及完成一次SVG渲染测试,就再也找不到这个模型的踪迹。

一场迟到了两个多月的发布,以一次不到半小时的“闪现”收场。这不像是一家手握全球最强AI实验室之一的科技巨头应有的节奏。它更像是在说:谷歌自己,可能都还没准备好。

一场迟到的发布会

2026年5月19日,Google I/O大会。Pichai正式发布了Gemini 3.5系列,但真正的主角Gemini 3.5 Pro却只出现在PPT的“coming soon”栏里。官方博客写道,3.5 Pro“已经在内部使用”,计划“下个月”向公众开放。200万Token的上下文窗口、“Deep Think”推理模式、前沿多模态理解。这些参数听起来足够前沿,足以让开发者期待。

但6月来了又走了。谷歌自己的API更新日志里,没有出现任何gemini-3.5-pro的模型ID。

7月1日,Business Insider率先报道谷歌已将发布时间推迟到7月,原因是“需要更多时间收集早期测试者的反馈并调优模型”。7月13日,TechTimes泄漏了新的内部目标日期,7月17日。这个日期也无声无息地过去了。7月16日,Bloomberg曝出更尖锐的细节:Gemini 3.5 Pro之所以延期,是因为模型在编码能力上未达到内部目标。同一天,关于人才流失的报道开始浮出水面。四名高级Gemini研究员在六天内相继离开,其中三人加入Anthropic,另一人去了OpenAI。

7月21日,谷歌发布了三款新模型。Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber,但唯独没有Pro。Reuters报道称,谷歌仍只表示Pro“正在与合作伙伴测试”。

然后到了7月31日。Arena平台(原LMArena,基于真实盲测投票与Elo评分的开源AI模型评估平台,覆盖文本、代码及视觉任务)上突然出现了一个未标注的模型。根据X平台用户的截图,该模型在约30分钟后被移除。用户Harshith仅完成了一次SVG生成测试就再也无法访问。

这30分钟的“闪现”,是谷歌73天来对Gemini 3.5 Pro最接近“公开发布”的一次动作。但与其说这是发布前的预热,不如说是一次不小心暴露的阶段性测试。

代码这道坎,谷歌为什么迈不过去

Gemini 3.5 Pro的延期,核心矛盾集中在一个点上:编码能力。

Bloomberg在7月16日的报道中引述知情人士称,Gemini 3.5 Pro在内部评测中未达到预期的编码基准。这听起来像一个技术细节,但它暴露了谷歌在AI竞赛中一个更深层的结构性短板。

编码能力是当前AI模型竞争最激烈的战场。在SWE-bench Pro上,一个衡量真实仓库代码编辑能力的基准测试,Anthropic的Claude Sonnet 5拿到了63.2%,OpenAI的GPT-5.6 Sol达到64.6%,两者几乎持平。而前一代的Claude Fable 5更是以80%的得分遥遥领先。谷歌自己的Gemini 3.1 Pro在SWE-bench Pro上仅拿到54.2%,在统一测试框架下甚至只有46.1%。如果3.5 Pro不能在编码上实现质的突破,它的“旗舰”定位就会大打折扣。

问题在于,编码能力的提升不是靠堆参数就能解决的。它需要高质量的训练数据、精准的指令微调、以及大量的实际场景测试。谷歌在Gemini 3.5 Pro上选择了“更长时间的内测”,把模型放到Antigravity平台和Arena上让早期用户测试,收集反馈后再优化。这种策略本身没有问题,但在竞争节奏极快的AI行业,每多花一天调优,就可能失去一批开发者用户。

更深层的问题是,谷歌在编码领域的布局一直存在“组织孤岛”问题。Gemini团队、DeepMind团队、Antigravity团队各有各的优化目标,但编码能力的提升需要端到端的协同。当Anthropic和OpenAI把编码能力作为模型的第一优先级来训练时,谷歌的模型既要兼顾多模态、又要保证长上下文、还要追求推理能力,目标太多反而分散了资源。

人才流失:比延期更危险的信号

如果说延期是技术问题,那么人才流失就是战略问题。

6月18日,Noam Shazeer在X上发帖宣布加入OpenAI。Shazeer是谷歌首席科学家、Transformer架构的发明者之一,也是谷歌在大模型时代最核心的技术资产。两年多前,谷歌刚刚花了27亿美元从CharacterAI挖回他和他的团队。仅仅18个月后,他走了。同月,另外三位高级Gemini研究员也加入了Anthropic。六天之内,四名核心研究人员集体出走。

这对于一家在AI人才争夺战中投入了数十亿美元的公司来说,信号再清晰不过了。

更值得关注的是这些人才流向了哪里。Anthropic和OpenAI,恰恰是谷歌在AI模型赛道上的两个最大竞争对手。Shazeer加入OpenAI时,Sam Altman回应说这是他“从OpenAI创立之初就最想合作的人”。而在Anthropic这边,三位高级研究员的加入让Claude团队的研究实力进一步强化。

Anthropic的Claude系列在2026年上半年持续保持强劲的迭代节奏。Claude Opus 4.6在Arena的文本排行榜上以1504 Elo分位居第一,Gemini 3.1 Pro Preview以约1493 Elo分紧随其后,差距11分,在统计上已经不算小。更关键的是,Anthropic的Claude Sonnet 5在7月1日如期发布,初始定价为每百万输入Token 2美元、每百万输出Token 10美元,9月1日后将分别上调至3美元和15美元。清晰的定价策略、明确的发布时间表、“编码优先”的产品定位,让Sonnet 5迅速成为企业客户的新选择。在谷歌不断推迟发布的同时,竞争对手正在用实际产品抢占开发者心智。

竞争格局不等人

Gemini 3.5 Pro的反复延期,不仅让谷歌自己在时间线上被动,更让竞争对手获得了宝贵的窗口期。

7月1日,Anthropic发布了Claude Sonnet 5。与此同时,OpenAI的GPT-5.6 Sol也在7月进入市场,主打网络安全和多步骤推理,在Terminal-Bench 2.1上取得了88.8%的标准得分和91.9%的Ultra模式得分。在SWE-bench Pro上,GPT-5.6 Sol以64.6%的得分略超Claude Sonnet 5的63.2%。两者虽然是旗鼓相当的对手,但它们的共同点是都如期发布了。

反观谷歌,7月发布的全部是轻量级模型。3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber在效率、成本和可靠性上确实有竞争力,但旗舰产品缺位,意味着谷歌在“最难的任务”这个战场上,暂时没有发言权。企业客户在评估AI供应商时,旗舰模型的能力上限决定了他们的采购决策。如果谷歌的旗舰模型迟迟不能交付,客户就会倒向Anthropic或OpenAI,而这种迁移往往是不可逆的。

在Arena排行榜上,排名前十的模型中有五款来自Anthropic和OpenAI。谷歌的Gemini 3.1 Pro虽然排名靠前,但已是上一代产品。如果Gemini 3.5 Pro迟迟不能上市,谷歌在核心基准测试中的排名只会继续下滑。更关键的是,开发者对谷歌的信任正在被消耗,每一次延期都让“相信谷歌能按时交付”这个命题变得更难成立。

还有一个不容忽视的维度:开发者生态。OpenAI有庞大的开发者社区,Anthropic通过Claude Code和API快速渗透企业级开发者。谷歌有Antigravity IDE,但作为一个2025年底才推出的产品,它的开发者基础远不如VS Code生态成熟。当旗舰模型缺席时,开发者甚至没有理由去尝试Antigravity。

谷歌的“拖延症”根源在哪

Gemini 3.5 Pro的反复延期,不能简单归咎于“技术能力不足”。谷歌在AI基础研究上的积累依然是全球顶尖的。DeepMind的研究产出、TPU的算力优势、以及谷歌庞大的数据资源,这些都不是Anthropic或OpenAI能轻易复制的。

真正的问题可能出在组织层面。谷歌的AI业务横跨Google Research、DeepMind、Google Cloud等多个部门,每个部门都有自己的优先级和KPI。Gemini 3.5 Pro作为跨部门的旗舰产品,需要协调的资源和利益太多,决策链条太长。当模型在编码能力上未达标时,是推迟发布还是降低标准发布?这个选择题在谷歌内部可能就需要几周时间来达成共识。

相比之下,Anthropic和OpenAI的组织结构更简单,决策更快。Anthropic可以在发现模型性能未达标时迅速调整训练策略,而不是陷入内部协调的泥潭。

另一个值得关注的点是,谷歌在2026年上半年的组织动荡。除了四名核心研究员的离职,谷歌还经历了多次内部重组。2025年收购CharacterAI团队后的整合尚未完成,新的组织架构带来的人事摩擦还在持续。而在这种动荡时期推出一个旗舰产品,难度可想而知。

一次“闪现”背后的真相

30分钟的Arena闪现,与其说是“意外泄露”,不如说是谷歌对Gemini 3.5 Pro现状的一次诚实投影。模型还在测试中,还在调优中,还在“和合作伙伴打磨中”。谷歌既不甘心在未准备好的情况下发布,又不愿意在竞争中被完全遗忘。于是有了这种“半推半就”的测试方式,上线,测试,撤下,然后当什么都没发生。

但问题在于,AI行业从不等人。每一次延期都有竞争对手推出新模型,每一次沉默都有开发者转向其他平台。谷歌有全球最强大的AI研究团队之一,有DeepMind,有TPU,有超过20亿用户的产品矩阵。这些资源不会消失,但它们需要被有效组织起来,转化成按时交付的产品。

在AI这个赛道上,最好的模型不是参数最大的那个,而是能准时交付到用户手中的那个。Gemini 3.5 Pro或许终将到来,但73天的延期和30分钟的闪现,已经让谷歌在信任账本上写下了一笔需要很久才能赎清的负债。

当你的竞争对手在发布产品时,你还在测试。这不是策略,这是被动。

作品声明:内容由AI生成