![]()
大模型的军备竞赛仍在加速。
9月初的三天内,已有5家头部厂商迭代了自己的旗舰模型。
当地时间9月1日,Anthropic推出Claude Fable 5.1与Claude Mythos 5.1,定位是“目前面向编程和知识工作的最强模型”,编程跑分直接翻倍。前者向普通用户开放,后者则依然不开放个人申请,仅能通过Anthropic的可信访问计划(Trusted Access Programs)获取。
9月2日,谷歌也连发Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款模型,继续强化“速度+成本”的路线,在价格不涨的情况下提升了软件工程和Agent工作流上的表现。而这次迭代距离其3.7 Flash的更新仅仅隔了三周。
当日,Meta也更新了Muse Spark 1.3,瞄准长周期Agent任务,重点提升复杂上下文处理和编程能力。
同时,中国厂商阿里也升级了被称为Qwen家族最强模型的Qwen3.8-Max,重点提升了编程、办公能力。
而就在刚刚(北京时间9月4日凌晨),OpenAI也正式推出了预告多时的GPT-6 Astra,并称其为“迄今为止最强的软件工程模型”。该模型也被视为GPT的又一次划时代之作,OpenAI总裁格雷格·布洛克曼(Greg Brockman)还直称“欢迎来到AGI时代”。
如果再稍微往前追溯,腾讯在8月28日发布了新一代大模型混元Hy4 preview,相比前代在软件工程、办公分析等生产力场景的表现有了明显提升。
智谱则于8月14日发布了GLM-5.3,编程能力较GLM-5.2提升50%,号称“专为编程而生”。
而7月发布的Kimi K3,同样因比肩当时OpenAI、Anthropic主力模型的性能,尤其是超越Fable 5的编程测评得分爆火。
从过去的两个多月,到这堪称疯狂的72小时,可以看到很多共同的关键词。
包括价格向一个相对平均的水准收敛,以往更以性价比取胜的中国模型在提价,美国顶尖模型的实际订阅花费则有所下降。
包括对办公、科研能力的聚焦,其对应的又是Agent自主工作能力和模型最强性能的提升,一个落地到最实际、最日常的使用场景,一个上升到最前沿、高价值的场景。
这一切当然都指向AI落地的时代背景和现实诉求,不过,我们仍然可以看到,在各类更新中,编程这个最早落地的能力,仍然是最被看重的环节,也依然是竞争的焦点。
但相比于一年前,编程的竞争单位,从代码交付变成了任务交付,或者说是软件工程。
如果以此为线索,也能看到各个厂商不同侧重的某些共同目的。
比如最早在开发者群体中扎下根基的Anthropic,在更新中会更加聚焦长期、复杂编程任务的可靠性,并且降低达到这一目的的工具,即Agent编程的成本。对于Fable来说,这显然便于更多企业、开发者实际应用,而定价成谜、甚至据说小厂只能“跪求”的Mythos,可能走的还是花费巨额资金,得到领先行业一步的稀缺AI性能的路线。
谷歌和Meta其实是在“补课”的同时想办法跟上新的节奏。实际上,在Anthropic、OpenAI持续引领编程能力迭代,中国的Kimi、智谱快速追近期间,没能在这一赛道及时发力被视为Gemini去年“炸场”今年“惨淡”、Meta模型始终难以赶上第一梯队的主要原因。
所以,谷歌加快了迭代速度,一方面是加快编程能力追赶的步频,一方面是持续调节产品适应性,聚焦于编程能力与用户之间的适用性。与此同时,Gemini Flash系列一直强调效率和性价比,如果能补齐编程能力,这同样可以成为任务交付时代的优势。
Meta的逻辑同样是加强编程能力,但并非简单生成代码,而是让模型能够理解复杂上下文、调用工具,并持续完成一条更长的工作链。
对于中国厂商来说,编程能力的提升能够让原本走不通的付费模式找到真实的赚钱场景,且国内开发者和B端的编程应用场景、需求更多、更复杂。所以,在相关能力提升的同时,模型整体的API售价有提升,而且更多付费制的编程类产品真正走到了市场上。
编程依然被模型“置顶”的逻辑不难理解,与以往相同的是,代码仍是最易被验证的工作,在模型能力到达较高层级后,写文章、做设计,甚至研究分析、策略建议都更难立见高下,但代码跑得怎么样,其产出结果仍然能够进行相对清晰的比较。
而对于今年来说,Agent和AI落地是贯穿全年的重点所在,编程则天然适合Agent,开发本身就是一条完整的Agent工作流,而且是机器最熟悉的工作流,也同样便于验证。对于落地来说,如上所述,从交付代码到交付任务的变化本身就被视为AI落地的“第一步”。
目前来看,各大模型的Agent编程也已走到了一个相对成熟的地步,下一步可能就是“自动驾驶”级的多Agent协作完成全流程开发、测试、部署、运维,就像一个真正的软件工程团队一样。这也是在供应端AI编程能真正形成生产力,进入企业的业务流程的重点所在。
不过,可能更值得关注的问题还有编程作为“元能力”如何扩散。
在8月31日智谱发布半年报后的业绩说明会上,提问环节有“Coding三连问”,包括编程能力的长期壁垒、为何选择编程作为模型能力突破的起点,以及编程能力如何迁移到其他专业场景。
智谱强调编程能力在网络安全领域的率先突破。网络安全底层能力与复杂编程Agent高度一致,实际上GLM-5.3一大重点突破就是网络安全漏洞发现,智谱发布模型时也宣称“随时迎接网络防御挑战”。智谱方面还表示下一步会把编程训练出的长程规划、工具调用和错误恢复能力继续迁移到数据分析、复杂自动化、法律、金融等高价值专业工作。
摩根士丹利则在分析中认为应重点关注编程能力向Co-work等领域的扩张。而智谱也在财报战略聚焦中给出了自身对模型能力演进的判断:Chat→Coding→Agent→Co-work→Autonomous AI,并称目前公司重心处在第二级(Coding)到第四级(Co-work),最终会向交付持续运行能力,在无人值守的条件下承担长期目标的Autonomous AI方向进化。
实际上,这种编程能力扩散、迁移的新战役可能已经打响。
OpenAI的Astra就直接冲到了端到端自动化,聚焦在专业工作中进入用户的软件环境,完成完整任务,并且在运行测试中发现问题,再持续改进。
或许,刚刚过去的“疯狂72小时”,只是大模型又一次巅峰之战的开端。(本文首发于钛媒体APP,文|飞向TAI空,作者|胡珈萌,编辑|盖虹达)








快报
根据《网络安全法》实名制要求,请绑定手机号后发表评论