Opus 5.2 与 Gemini 4 Pro 未经官宣已上线,前沿模型的发布流程正在被压缩

AGI
没人开发布会。可硅谷这一周,比任何发布会都热闹。

1

过去两周,Anthropic 将两个尚未命名的模型接入生产接口,谷歌为下一代旗舰沿用旧版本号、投放到第三方盲测平台,OpenAI 在 Astra 之后未再公开发声。三家都没有为下一代模型开发布会,官方也没有发布任何说明。多数人并未意识到,自己已在为尚未发布的模型提供测试样本。

9 月 17 日晚,Anthropic 切断了灰度通道。一批原本被路由至新模型的账号归零,在开发者社区引发集中讨论。一天后通道恢复,覆盖范围从 Claude Code 扩大至 Chat 和 Cowork。有开发者把这段经历称为“午夜惊魂”。

当天晚上,谷歌也被发现了。第三方盲测平台 Arena 上出现了一个名称并不起眼的模型,代号 gemini-3.8-flash。抽到该模型的用户很快注意到异常:它绘制的鹈鹕带有完整的蹬踏动作,生成一张 PS5 矢量图需十分钟、输出数千行代码,搭建的体素宝塔可在浏览器中实时旋转。3.8 Flash 是早已上线的轻量模型,不具备这样的能力。社区随后判断,这是谷歌下一代旗舰 Gemini 4 Pro,内部代号 Argon。被发现后,该名称又被改为 gemini-3.7-flash。

再往前三天,有开发者发现,Claude Code 界面调用的模型标注为 Opus 5,返回结果却来自另一个模型。对接口请求的抓取显示,后端模型标识已指向 5.2。Opus 5 发布于 7 月 24 日,其间没有 5.1,版本号直接跳至 5.2。此后 Fable 5.2 灰测的消息一并传出,一部分原本调用 Fable 5.1 的请求被后台路由至新的检查点。没有模型卡,没有 API 标识,也没有定价表,Anthropic 未作任何说明。

把新模型先接进现有产品

三家做法并不相同,Anthropic 采用后端路由,前端仍显示旧名称,普通用户无从察觉;谷歌的方式更简单,在第三方盲测平台上沿用旧版本号;OpenAI 则在 Astra 发布之后未再公开发声,公开议题转到了对手之间的对比上。

对厂商而言,这样做的收益相当直接,模型在尚未正式命名的阶段即可获得真实负载下的表现数据,一旦出现问题可以随时回退,无需承担公开发布失败的风险。

一个前沿模型正式发布,意味着需要提前配置足以承接瞬时峰值的算力。GPT-6 Astra 动用得州 Stargate 基地超过 10 万张 GPU 完成训练,API 定价为每百万输入 10 美元、每百万输出 50 美元,是上一代 Sol 的 2.5 倍。灰度路由的算力投入远低于此:新模型混入旧模型流量,厂商可以控制被路由至新模型的请求比例,在观察真实表现的同时逐步提高占比。

比成本更难处理的是容错。6 月 9 日,Fable 5 与 Mythos 5 发布;三天后的 6 月 12 日,美国商务部下发出口管制指令,要求暂停向任何外籍人士提供这两个模型。由于无法实时核验用户国籍,Anthropic 将模型对全球用户下线,直到 7 月 1 日 Fable 5 才恢复访问。一次全量发布,换来一次全量下架。此后,团队再做发布,都会倾向先小范围释放、观察反馈。

口碑的影响更难量化:用户调用的是 Opus 5,实际得到的是 5.2,体验改善明显,却难以归因。等到开发者社区开始流传“Claude Code 最近变强了”,传播已经完成,而官方未作任何说明。

为什么放弃发布会环节

就在 Opus 5.2 被发现的两天前,Anthropic CEO 达里奥·阿莫代伊发表长文,主张全行业主动放慢前沿模型的迭代速度。他的理由是,模型能力增长过快,安全与对齐工作已经难以跟上;若能放慢一至两年,并将这段时间用于安全研究,风险将明显下降。文章发出后,马斯克与 OpenAI 的奥特曼均公开表示支持。奥特曼还提到一项具体安排:出于安全考虑,OpenAI 今年不会上市。

市场的反应很快,随后的第一个交易日,费城半导体指数下挫 5.86%,英伟达下跌 3.36%,全球半导体与 AI 算力硬件产业链当日市值蒸发超过 5000 亿美元。

这几天里,Claude Code 中的新检查点仍在运行。

三家的处境并不相同,OpenAI 月初发布的 GPT-6 Astra 目前占据约 13% 的企业 AI 支出,Anthropic 的 Fable 系列约为 8%。Anthropic 正在筹备上市,6 月已秘密提交申请,目标估值最高 2 万亿美元,时间窗口定在 11 月中期选举之前。

在这一节点上,一次体验不佳的主力模型发布会,会成为路演材料中的不利因素,而 Opus 5 的市场口碑本就偏弱。谷歌的处境更为被动:旗舰 Pro 系列已空缺数月,3.5 Pro 被搁置,算力集中投向 Gemini 4,产品线暂时只能由 Flash 系列支撑。

ARC-AGI-3 的 99.9% 和 62.7%

灰测期间流传较广的一种说法,是“Fable 5.2 在最高推理档位下碾压了 GPT-6 Astra”。

在笔者看来,这一说法需要分两层看。它来自一位开发者的个人对比测试,原话是“输出看起来明显优于 Astra”,且该开发者同时指出代价是更慢、更贵。另一层背景是,Anthropic 上一代模型本已领先:在 Artificial Analysis 的综合智能指数中,Fable 5.1 为 66,Astra 为 61;编码智能体指数则为 70 比 67。因此“5.2 碾压 Astra”未必是误判,但差距的一部分来自 Astra 自身的基准设置。

OpenAI 发布 Astra 时主推的一项成绩,是 ARC-AGI-3 得分 99.9%。但该成绩取自 OpenAI 自行配置的 harness;换用行业标准 harness 测同一个模型,得分降至 62.7%,相差 37 个百分点。

三个时间点之间的间隔只有十四天:9 月 3 日 GPT-6 Astra 发布,9 月 14 日 Anthropic 将下一代模型接入接口,9 月 17 日谷歌跟进。

接下来有三个时间节点可供确认:Opus 5.2 最快 9 月底、最晚 10 月底全面开放;Gemini 4 Pro 预计 10 月正式发布;以及 OpenAI 是否会推出新模型,回应这一次“被灰测超越”。预测市场上,9 月 30 日前发布新 Opus 的概率一度超过八成。

截至目前,Opus 5.2 与 Gemini 4 Pro 均无模型卡、API 标识和定价信息。三家公司都尚未正式表态。(本文首发钛媒体APP,作者 | AGI-Signal,编辑|秦聪慧)

作品声明:内容由AI生成
本文系作者 AGI-Signal 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

登录后输入评论内容

快报

更多

2026-09-20 22:54

美联储卡什卡利:通胀仍然过高,不仅仅源于油价因素

2026-09-20 22:52

长鑫科技:第五代工艺技术平台实现量产

2026-09-20 22:50

中美经贸磋商在美国纽约开始举行

2026-09-20 22:47

特朗普:也门胡塞武装同意不与美国交战

2026-09-20 22:43

古尔曼:苹果最早将于下月推出智能家居屏幕设备

2026-09-20 22:40

特朗普称将对伊朗作出重大决定

2026-09-20 22:29

农业农村部部署进一步规范农药兽药网络经营秩序

2026-09-20 22:09

沐曦股份完成对Qwen-Image-2.1模型的适配

2026-09-20 21:34

下周(9月21日-27日)市场大事预告

2026-09-20 21:17

造谣“宁德时代宜宾基地班长不让普工上厕所” 男子被行拘

2026-09-20 21:09

马斯克预言:AI将使明年美国GDP增速翻番达到4%

2026-09-20 21:08

中国推进7项天然气国际标准成功立项

2026-09-20 21:00

伊朗在边境地区部署大规模部队

2026-09-20 20:52

招商证券:有业绩支撑的科技权重有望迎来补涨,后续市场有望迎来变盘节点

2026-09-20 20:44

中信建投:第二轮修复行情展开

2026-09-20 20:43

长治沁源累计复产8座煤矿,中秋节当日三大口岸闭关1天

2026-09-20 20:26

9月20日新闻联播速览23条

2026-09-20 20:15

文旅部:推动各地将公共文化数字基础设施建设纳入新型基础设施建设

2026-09-20 20:07

文旅部印发《公共文化服务体系建设“十五五”规划》

2026-09-20 19:52

2025年全国科普工作经费筹集额超243亿元

扫描下载App