定价仅为对手六分之一,Gemini 3.8 Flash落地B.AI

2026.09.04 14:09
9月4日,B.AI平台接入Google DeepMind Gemini 3.8 Flash模型API。这款定价$0.75/$3.75的Flash级模型,输出速度达305 tok/s,在金融和法律Agent基准上超越Claude Opus 5和GPT-5.6 Sol,成本仅为对手六分之一。谷歌不是在发布一个模型,而是在为Agent时代铺建算力管道。

当你的AI Agent每天要跑一万次调用,成本就是商业模式本身。

9月4日,B.AI平台正式接入Google DeepMind最新发布的Gemini 3.8 Flash模型API。就在两天前,谷歌刚在官方开发者博客上宣布了它的全面可用。从官宣到上架第三方平台仅隔两天,速度快得不像是一家大公司的节奏。

这不是一次普通的模型更新。Gemini 3.8 Flash是Gemini 3家族中首个明确将"长周期软件工程"和"自主Agent"作为设计目标的Flash级模型。在这个价位上,没有竞品敢说自己是为此而生。

三个信号,一个指向

信号一:定价锚点

$0.75/百万输入Token,$3.75/百万输出Token。这是Gemini 3.8 Flash的入门价格,有效期到2026年12月31日。2027年1月1日起翻倍至$1.50/$7.50,即便如此,仍是市场地板价。

对比一下同档竞品:Claude Opus 5定价$5/$25,GPT-5.6 Sol定价$4/$20。Gemini 3.8 Flash的价格约为对手的六分之一。

但低价不是故事的全部。速度才是匹配价格的另一面。独立评测机构Artificial Analysis测得,Gemini 3.8 Flash的输出速度约为305 Token/秒,是当前所有可测模型中最快的。

信号二:明确的场景定位

谷歌官方对它的定位是:"our most intelligent Flash model, engineered for long-horizon software engineering, autonomous agents, and complex enterprise workflows."

翻译成行业语言就是:这不是一个通用聊天模型。它是一台为"AI Agent工作流"造的发动机。

信号三:第三方平台闪电接入

B.AI是一个集合了OpenAI、Anthropic、谷歌、DeepSeek、月之暗面、阿里Qwen等多家模型的聚合API平台,提供统一的OpenAI兼容接口和Web2+Web3双通道支付系统。Gemini 3.8 Flash在发布后两天内完成接入,意味着谷歌对这一渠道的优先级极高。截至8月31日,B.AI平台累计Token吞吐量已突破5.74万亿。

这三个信号指向同一个判断:谷歌不是在"发布一个模型",而是在铺一条"Agent时代的算力管道"。

为什么是"Agent工作母机"

对开发者来说,选模型从来不是选"最强"的,而是选"够用且足够便宜"的。

Gemini 3.8 Flash的定价和速度组合,恰好切中了Agent开发最核心的经济账。以一个每日运行1万次Agent调用的中等规模应用为例,假设每次调用平均消耗5000 Token,使用Opus 5的日成本约为$250-$300,而使用Gemini 3.8 Flash仅需约$40-$50。日积月累,一年差距在7万到10万美元之间。对于创业公司和中小开发团队,这个成本差决定了产品能否盈利。

但价格优势必须以性能为前提。在关键场景中,Gemini 3.8 Flash的表现超出了"够用"的水平。在Vals Finance Agent v2上,它得分61.4%,超过Claude Opus 5的58.6%和GPT-5.6 Sol的53.8%。在Harvey Legal Agent Benchmark上,它拿下10.0%,远超Opus 5的6.7%和GPT-5.6 Sol的2.5%。在Terminal-bench 2.1的Agent编程任务中,它得到89.4%,略超Opus 5的89.1%。

在金融和法务这两个高专业门槛领域,3.8 Flash以六分之一的价格实现了对前沿模型的领先。这意味着对于大量企业内部Agent场景,它的性价比曲线呈现出前所未有的陡峭。

短板在哪里,谁不该用它

Gemini 3.8 Flash并非没有弱点。

在DeepSWE v1当前最硬核的长周期软件开发基准测试中,它得分71.0%,落后于Opus 5的74.0%和GPT-5.6 Sol的72.7%。这意味着如果你要让Agent独立完成复杂的跨文件工程任务——重构代码库、多模块联调、长周期自动化Bug修复——Gemini 3.8 Flash还不够强,前沿模型仍是最安全的选择。

另一个值得关注的信号来自社区评测。在Terminal-Bench 4.0的特定评测中,有评测者指出3.8 Flash得分骤降至19.1%,而Opus 5可达51.8%。虽然这部分数据尚待大规模交叉验证,但它指向一个方向:Gemini 3.8 Flash在特定类型的终端交互流中可能暴露出显著短板。

所以它的正确用法不是"替代所有",而是在Agent架构中按场景路由。金融与运营类Agent交给3.8 Flash,它的成本和精度最优。高吞吐、低延迟的日常任务也交给它,305 tok/s的速度是实打实的优势。中等难度的Agent编程同样可以信任它89.4%的得分。但最难的长周期软件开发,还是留给前沿模型。

在多模型路由架构日益成熟的今天,这种分工不是妥协,而是Agent工程的最佳实践。

谷歌的AI基础设施叙事:从模型到管道

过去12个月,谷歌在AI基础设施层面走了一条与OpenAI截然不同的路。

OpenAI选择以垂直整合的方式构建生态:自研模型、自建算力、自控API入口。而谷歌的策略是"模型+平台+开放渠道"三管齐下。仅过去六周内,谷歌就连续发布了3.6 Flash、3.7 Flash和3.8 Flash三代Flash级模型,迭代频率前所未有。与此同时,其Antigravity Agent开发平台、Google AI Studio免费层,以及通过B.AI等第三方平台的分发,构成了一个开放式的"Agent基础设施底座"。

这个策略的深层逻辑是:如果Agent真的是下一代应用形态的主导范式,那么谁控制了Agent的"算力供应",谁就掌握了生态命脉。在这个框架下,Gemini 3.8 Flash不是一款产品,而是一个锚定价格、锚定场景的战略节点。

类比来看,谷歌正在为Agent时代铺建一条算力高速公路——用Flash系列的低价和高速吸引开发者上道,然后将高价值的Pro级需求、边缘推理部署和长尾企业服务锁定在自己的平台上。

两个你以为,一个真相

你以为谷歌在和OpenAI拼最强模型?不是。它在拼"哪个平台能让开发者花最少的钱、跑最快的Agent"。在以成本为导向的Agent经济中,Gemini 3.8 Flash的定价策略正在改写竞争规则——不是谁更强,而是谁更便宜且还够强。

你以为B.AI只是个普通的API聚合平台?不完全是。它同时打通了Visa、微信、支付宝、银联和加密结算的支付体系,为全球开发者提供了极低摩擦的算力获取通道。谷歌选择在此上架,意味着它对新兴开发者生态的重视程度不亚于对传统云渠道的投入。

这条路的终点是什么?当Agent真正成为数字劳动力的基本单位,当每家企业都拥有10个、100个甚至1000个AI Agent时,"谁提供的算力更便宜"将成为一个决定性的竞争优势。Gemini 3.8 Flash在B.AI的上架,是谷歌在这场长期博弈中放出的一颗关键棋子。

留给竞品的问题是:你敢跟进这个价格吗?

当对手还在比拼"谁更强",谷歌已经开始定义"够用且足够便宜"的新标尺。在Agent经济里,成本不是约束,而是战略。

作品声明:内容由AI生成