文章详情顶部

谷歌连发三款Flash,以“机海战术”再度加码AI企业端基本盘

AGI
距离上代发布仅三周,谷歌火速上线Gemini 3.8 Flash,创下短期内三款大模型的“疯狂纪录”。在核心人才流失与旗舰模型缺位的阵痛下,谷歌正试图用低价与“循环试错”的暴力美学,重新锚定Agent时代的工作流标准。然而,当大模型从“智商跑分”转向真实的“单任务总成本”博弈,这种以算力换能力的降维战术,真的能帮谷歌守住商业护城河吗?

文 | 塔猴

9月初,距离3.7版本发布仅仅过去三周,谷歌毫无征兆地掷出了最新底牌——Gemini 3.8 Flash正式上线。这标志着谷歌在短期内,已经连续向市场倾泻了三款Flash系列模型。

从数据来看,这似乎是一次“超常发挥”:在LMArena最新榜单上,3.8 Flash空降Agent榜单第14名,以微弱优势险胜DeepSeek-V4-Pro;在HLE-Verified等极端测试中拿下54.9%的高分,且API定价与3.7版本保持了绝对一致的“半价”水准。正如DeepMind内部成员姚顺宇发帖暗示的那样,这对于RSI(快速顺序迭代)而言,是一次巨大的飞跃。

然而,剥开跑分狂欢的外衣,这不仅仅是一次简单的技术更新。在竞争白热化的大模型下半场,谷歌近乎焦虑的更新频率,正折射出行业最底层的竞争逻辑生变。

疯狂的谷歌,用“机海战术”守住基本盘

把时间轴拉回半年前,大模型赛道的更新节奏仍以季度甚至半年度为单位。但如今,Flash系列的迭代频率已经被谷歌粗暴地压缩到了“周”。

在3.8 Flash的更新中,谷歌将技能树极其偏执地全点在了代码(Coding)与智能体(Agent)能力上。在DeepSWE v1.1测试中,它已经能够端到端自主解决复杂的工程问题,得分超越了众多体型庞大的前沿模型。除了常规版本,谷歌甚至在内部实装了史上最强网络安全模型——3.8 Flash Cyber。这款只通过Fairwind计划向受信防御者开放的“幽灵模型”,在内部代码库漏洞挖掘成功率超过70%,产出的正确补丁数量是竞品的2.6倍。

一切都在追求极致的输出速度与应用覆盖。数据显示,3.8 Flash目前是市面上输出最快的模型,断崖式碾压了排名第二的Meta近一倍。

用令人窒息的高频迭代抢占市场存量,谷歌正在用行动宣告:不再等那个难产的完美旗舰,先用轻量级的“主力工作模型(Workhorse Model)”把坑占住。

从“智商战”到Agent时代的经济博弈

这背后是谷歌内部正在经历的一场剧烈阵痛与路线修正。

就在前不久,Google DeepMind刚刚经历了近年来最大的权力洗牌——侧重科学探索的Demis Hassabis退居幕后,而主导商业端对接的务实派Koray Kavukcuoglu接掌大权。伴随着Jeff Dean等联合创始级技术大牛的离职,谷歌的权力中心彻底从“学术实验室”转向了“硅谷商业场”。

这种转向的直接结果,就是大模型评价体系的重构。过去,大模型的计费核心是“Token单价”,纯拼参数与智商。但在Agent时代,工作流的交付能力成为了核心考量。

面对复杂任务,3.8 Flash展现出了一种截然不同的“邪修”方法论:当OpenAI和Anthropic都在追求用更少的步骤完成任务时,Gemini 3.8 Flash却选择了“大力出奇迹”——通过在底层机制中引入更多的Loop(循环)、反复迭代调用工具、增加多步规划,用步骤数量来弥补单次推理智能的不足。

这就是新帅Koray算清的一笔“经济账”:既然旗舰模型3.5 Pro迟迟达不到断层领先的预期,那就用腰斩的试错成本,叠加足够胜任80%生产任务的Flash模型,吸引开发者将其深度嵌入Google Cloud、Workspace等生态基建中。一旦企业习惯了这种高频的调用模式,高昂的代码重构成本将成为谷歌最坚实的护城河。

大力出奇迹背后的成本陷阱

这种靠“笨鸟先飞、疯狂加练”换来的高分,真的具有性价比吗?

值得注意的是,3.8 Flash看似一分没涨,但其背后的“Loop”机制暗藏玄机。在高难度任务(High-effort档位)下,模型需要反复试错回传,这意味着它可能会比前辈们燃烧成倍的Token。如果一个指令模糊的任务导致程序陷入工具调用的死循环,最终推高的“单任务总成本(Task Cost)”不仅会抹平半价的红利,甚至可能比直接调用旗舰模型更贵。

更致命的是技术上的“代差”隐患。有开发者指出,3.8 Flash在8月底刚上线的Terminal-bench 4.0等新测试中表现挣扎,暴露了其“刷榜”的嫌疑。一旦剥离了死记硬背的套路,基础智能的短板依然存在。

竞争对手也没有停止阻击。就在谷歌发模型的当口,Meta直接端出了对标Opus的高阶模型Muse Spark 1.3,并在Agent和Coding能力上大幅跃升,甚至公开嘲讽:“Gemini,谁啊?”。这种四面楚歌的境地,正是因为谷歌迟迟交不出强大的旗舰模型来“向上兜底”。

分层路由与企业的清醒时刻

跳出单一企业的得失,谷歌的这支“穿云箭”,实际上彻底拉开了大模型产业走向“分层路由(Model Routing)”时代的闸门。 单一模型通吃天下的军备竞赛已经结束。未来的企业AI架构必将走向两极分化:GPT-5、Claude Opus等顶尖旗舰充当“特种部队”,负责兜底决策与深层推理;而Gemini Flash这类轻量级平替,则化身“常规军”,承接高频的流水线作业。

但对企业而言,技术决定了AI的上限,真实的投入产出比(ROI)才决定了商业落地的底线。在享受Flash半价红利的同时,必须对实际端到端耗时、人工重试率进行压力测试,保持架构的弹性,坚决不与单一API彻底绑死。 如果企业缺乏分层调用的经验判断,与其盲目摸索推高沉没成本,不如借助如塔猴这类专业的AI内容商业化服务平台,按需匹配实战创作者,以极低的门槛释放AI的最大势能。

大模型的下半场,拼的不再是谁的实验室理论极值更高,而是谁能以最优的结构效率,真正地“把事做完”。

本文系作者 塔猴 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里

敬原创,有钛度,得赞赏

赞赏支持
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

登录后输入评论内容

快报

更多

20:06

纽约证券交易所与韩国交易所签署合作谅解备忘录

19:59

远大控股:副董事长许强拟减持不超54万股

19:59

九鼎新材:目前未涉及电子布业务,涉及航空航天领域的产品份额较小

19:55

四川绵阳市北川县发生4.8级地震,震源深度10千米

19:55

长电科技:拟定增募资不超65亿元用于高性能计算高端先进封装平台扩产项目等

19:50

四川长虹:与专业投资机构共同投资设立长虹科创基金

19:45

农业农村部召开全国粮油作物大面积单产提升现场会,强调更高水平推进大面积单产提升

19:44

伊朗官员:未经同意 霍尔木兹海峡之“锁”不会打开

19:42

慕思股份:选举王炳坤为董事长

19:38

普洛斯佛山智算中心定制项目启动建设

19:35

江波龙:截至8月31日尚未开始实施股份回购

19:35

乌外长:俄乌和平进程有望迎来新进展 或重启磋商

19:29

国开行:2026年新型政策性金融工具已实现首批项目4.6亿元资金投放

19:26

华丰科技:拟与关联方共同投资设立长虹科创基金

19:26

圣诺生物:利那洛肽胶囊获得药品注册证书

19:21

软通动力:拟出资2000万元参与设立具身智能领域创投基金

19:19

美元兑日元下破156大关

19:18

鑫宏业:拟发行不超11亿元可转债,用于核电站用特种电缆及电气贯穿件研发及产业化项目等

19:17

德豪润达:子公司拟出售闲置资产

19:17

冠昊生物:向特定对象发行股票申请获证监会同意注册批复

扫描下载App