GPT-6 Astra 刚刚发布,但 OpenAI 已经用资源投票——下一代才是战场。
2026年9月初,OpenAI发布了号称世界最强模型的GPT-6 Astra,105万词元的上下文窗口、12.8万词元的输出上限。CEO Sam Altman在CNBC上将其定义为"新能力层级"。而在几乎同一时间,OpenAI应用研究主管Boris Power在Fellows Forum 2026上抛出一段话,像一盆冷水浇在产品狂欢的庆祝香槟里:公司80%到90%的研发力量,已经全面转向GPT-7、GPT-8及后续代际模型。
这不是一句模糊的方向声明,这是一个精确到两位数的资源分配数字。它直接把OpenAI最核心的战略判断摆上了台面:同代内的渐进微调——从GPT-5.1到GPT-5.2、从GPT-5.5到GPT-5.6——只是短期投资;真正的技术价值核心和性能飞跃,永远来自下一代的基底模型。
GPT-6刚刚上线,钱已经投给了GPT-7
2026年9月3日,OpenAI发布GPT-6 Astra,Fortune、CNBC、Reuters的报道蜂拥而至。这是OpenAI迄今为止最强的模型:在Terminal-Bench Science上达到64.6%(GPT-5.6 Sol仅为22.4%),在FrontierMath Tier 4上达到97.6%,在GPQA Diamond上冲到96.0%。多项指标接近天花板。总裁Greg Brockman称之为"世代级的跃迁"。
就在这个节点,Boris Power在Fellows Forum上透露了内部研发资源的分配状态。80%到90%——这意味着在GPT-6 Astra的数百名工程和维护人员之外,OpenAI还有另一支更庞大的技术军团,他们的目光已越过刚刚上线的旗舰,锁定了两到三代后的基底模型。
这不是孤例。就在GPT-6 Astra发布前不久,社交媒体曝出OpenAI已经完成了一轮代号"Bel"的新预训练——一个超过10万亿参数的巨型基底模型。尽管OpenAI从未官方确认Bel的存在,但多个追踪者的交叉分析认为,Bel很可能是GPT-6系列后续版本的基础架构。这一信息与Boris Power的表态形成了微妙呼应:公司内部确实存在一条"预训练→对齐→产品发布"的长周期管线,而这条管线最花钱、最烧算力、最依赖顶尖人才的前端,已经被GPT-7及后续代际填满。
同期,GPT-5.6 Sol刚刚在Artificial Analysis的Coding Agent Index上以80分领跑全场,在Intelligence Index上以59分仅落后Claude Fable 5的一分,成本却只有对手的三分之一。但OpenAI显然不认为这种迭代微调值得继续投入主力研发资源。
渐进微调:面包屑还是方向误判?
从GPT-5在2025年8月7日发布,到GPT-5.6 Sol在2026年7月9日登场,OpenAI在GPT-5这一代上推出了至少6个子版本:5.1(2025年11月)、5.2(2025年12月)、5.3、5.4 Thinking(2026年3月)、5.5(2026年4月)、5.6 Sol/Terra/Luna(2026年7月)。每一次迭代都带来了可量化的提升,GPT-5.5在Intelligence Index上得56分,5.6 Sol提升到59分。
在ARC-AGI-3基准上,启用"保留推理"和"压缩"功能后,同样一个GPT-5.6 Sol模型的公共集得分从13.3%跃升至38.3%,输出token反而减少至约六分之一。OpenAI在官方博客中写道:"模型完全没有变更,效能却提升至近三倍。"
这些数据会让外界觉得:不断微调,日子过得挺好。
但OpenAI内部的看法完全不同。Boris Power直接将同代微调定性为"短期投资"——能产生快速迭代,能稳定用户预期,能维持股价和生态伙伴的信心。但它不会带来真正的智能飞跃。
这句话的潜台词是:你可以在同一个地基上不断装修翻新,换更好的瓷砖、刷更白的墙、装更大的窗户,看起来每次都更好一些。但真正的质变是换地基本身。GPT-7就是那个新地基。
独立评测平台Artificial Analysis提供了一个有趣的侧面验证。GPT-5.6 Sol在Intelligence Index上每个任务的成本约为1.04美元,而性能几乎伯仲之间的Claude Fable 5需要2.75美元,近三倍的价差。这套成本结构暗示了一条内部逻辑:当模型在同一个代际内不断微调,边际收益在递减,而每次微调后的对齐、测试、部署成本却在累积。与其把顶尖人才锁在收益递减的流水线上,不如把他们重新配置到下一张图纸上。
为什么OpenAI敢把八成筹码押给未知?
把80%到90%的研发力量押在未来两到三代的基底模型上,这是一件在外界看来近乎偏执的事情。
GPT-6 Astra刚刚发布,市场反馈还在发酵,竞争对手没有休息。Anthropic在2026年6月推出Claude Fable 5之后,9月1日又发布了Fable 5.1,9月22日再推Opus 5.5——不到四个月内三连击,在Intelligence Index上最新达到58分,重新夺回榜首。
Google的产品矩阵同样全面铺开。2026年5月,Google I/O上推出的Gemini Spark作为全天候AI代理人切入消费端,基于Gemini 3.5和Antigravity平台,能在设备离线后继续运行任务。Google没有选择大版本迭代表面上竞赛,而是用产品广度和Agent生态来对冲技术参数的局部落后。
Meta的Llama 4开源阵营则在另一个维度上持续施压。开源模型每一代的提升幅度正在逼近闭源旗舰,而成本壁垒的坍塌正在重塑整个行业的竞争规则。
在这种四面夹击的竞争强度下,抽调绝大部分研发力量去赌下一代基底模型,是不是过于激进?
但OpenAI的自信建立在一个已经被反复验证的规律上:每一次代际跃迁带来的能力增长,远超同代微调的累加效应。GPT-3到GPT-4是质的飞跃。GPT-4到GPT-5在编程、推理、长文本处理上的提升仍然显著——AIME 2025的94.6%(无工具)、SWE-bench Verified的74.9%,都是代际模型才能达到的量级。GPT-5到GPT-6 Astra,按照OpenAI自己的描述,是从"回答问题"到"主动做事"的范式转变——Astra可以在用户授权下直接操作电脑、填写表单、编写代码并执行、甚至独立生成完整的3D游戏世界。
这些跃迁不是靠微调堆出来的。
此外,GPT-5.6 Sol在ARC-AGI-3上的实验还暗示了一个更深层的判断:当同一个基底模型仅通过改进推理策略就将得分从13.3%提升至38.3%时,一个隐含的结论浮出水面——当前基底模型的潜力远未被榨干,但推理优化这条路的边际效应正在快速递减。真正的天花板不在推理策略上,而在模型本身的架构上限。
代际竞赛:AI行业最大的赌注
OpenAI的这次"资源交底",让整个AI行业一个深层的战略分歧浮出水面:走代际跃迁还是走渐进微调,哪条路才是通往AGI的最优路径?
Anthropic选择了与OpenAI高度相似的路线。Claude 4到Claude 5的代际跨越在2026年集中爆发,6月推出Fable 5,7月推出Opus 5,9月连发Fable 5.1和Opus 5.5。执行节奏几乎同频:先以代际基底型号确立能力上限,再以同代微调版本收割短期迭代红利。
Google走了一条不同的路。它没有参与大版本号的迭代竞赛,而是将重心放在Agent架构和产品矩阵的整合上。Gemini的Deep Research功能——自动执行数十次搜索查询并生成完整研究报告——表明Google对AI价值的判断是"模型能力服务于Agent能力",而非"参数越大越好"。这是一种更务实的策略:用产品广度对冲技术参数的局部落后。
Meta的Llama 4开源阵营则在彻底改写成本方程。当开源模型每一代的提升幅度越来越接近闭源旗舰,而部署成本以数量级降低时,OpenAI的全押代际策略面临一个潜在挑战:即使GPT-7的性能大幅领先,但如果Meta在相同算力投入下推出接近性能的开源模型,市场会如何选择?
三家公司,三条路线,一个共同点:没有人敢停下代际研发。差别只在于,你把多少力量押在下一代上。
回到OpenAI内部。80%到90%这个数字本身意味着,GPT-7很可能已经走过了概念验证阶段,进入了实际的架构设计和训练准备期。综合OpenAI的历史发布节奏——GPT-3到GPT-4间隔约3年,GPT-4到GPT-5间隔约1年半,GPT-5到GPT-6间隔约1年——GPT-7的发布窗口可能在2027年下半年到2028年上半年。届时,Astra时代的范式转变将被再次刷新,而那条渐进微调的赛道上,将只剩下短跑选手。
真正的赌注不在GPT-7,而在代际跃迁本身
Boris Power的这番表态,本质上是OpenAI向全行业的一次内部信息披露。
它在告诉市场:别盯着GPT-5.6和Astra的版本号更新,那不是主战场。它在告诉竞争对手:你们追赶Astra的时候,我们的精锐已经在做下一代。它在告诉开发者:你现在花精力适配的API接口,两三年后可能整个底层模型都会换掉。
这是一个风险极高的战略姿态。如果GPT-7没有带来预期的跃迁,如果性能提升只有GPT-5到GPT-6的量级而非GPT-3到GPT-4的质变,OpenAI将承受巨大的机会成本。Anthropic的Opus 5.5已经在2026年9月夺回Intelligence Index榜首,Google的Agent生态正在一天天筑高壁垒,开源社区的集体智能以每6到12个月追赶一代的速度在逼近。
但如果GPT-7押对了呢?如果全新的架构设计和更大规模的参数真的打开了通往AGI的那扇门,那么80%到90%就不是一个激进的比例,而是一个保守的底线。
这也是最体现OpenAI基因的选择。从GPT-3到GPT-6 Astra,这家公司从来没有因为某一款产品的成功而放缓对下一代的押注。每一次发布都是前一代研发的终点,也是下一代研发的起跑信号。
80%到90%的研发力量,押的不仅是GPT-7,更是一种信念:在通往AGI的路上,渐进微调只能让你不掉队,只有代际跃迁能让你领跑。
而最残酷的问题是——这条赛道上,没有第二名。






快报