毒圈缩圈:AI大模型的“斩杀线”还在上移

AGI
AI大模型行业进入残酷内卷时代,斩杀线持续上移、毒圈不断收缩。随着Agent成为主流应用方式,模型竞争从单轮对话跑分,转向任务维度的综合性价比对决。没有第二名、只剩生死局,持续降本迭代的赛道,不存在可以躺下的壁垒,只有所有厂商无法停歇的竞争跑步机。

文 | 云涌AI ,作者 | 黄云皓

2026年7月31日,DeepSeek发布V4 Flash 0731。新版在Artificial Analysis的Intelligence Index上得50分,比上一版V4 Flash高出10分。基于Intelligence Index v4.1评测数据,将各家模型放入一张散点图,纵轴是Intelligence Index得分,越往上能力越强;横轴是每任务成本,越往右成本越高。V4 Flash 0731落在左上,以它为起点向右下划出一片区域,区域内的模型成本更高、能力更弱。

Artificial Analysis Intelligence Index v4.1,DeepSeek V4 Flash 0731“斩杀线”
来源:Panda@Cerul.ai,X

Artificial Analysis Intelligence Index v4.1,网友制作的DeepSeek V4 Pro预测“斩杀线”版本
来源:Jen Zhu,X

中文AI圈把这片区域称作“斩杀线”,血量低于这条线的模型,一击即死。英文一侧叫Kill Zone(斩杀区)。而对斩杀线附近的模型来说,毒圈正在不断缩小。

两个词都出自电子游戏,同时在中英文AI圈流行,正是大模型行业竞争转向、烈度升级的信号。

一. Agent定义“斩杀线”

从对话到任务

Agent改变了模型的使用方式,从一次对话变成一项任务。为了完成任务,模型需要连续执行多个步骤、调用外部工具、在出错后重试,交付的是一项任务的结果。因此,单次回答的准确性已不能反映出模型交付任务结果的能力,而按token计价的测试也无法准确体现一项任务的支出。

2026年5月,美国国家标准与技术研究院下属的CAISI公布DeepSeek V4 Pro评估,将其与GPT-5.4 mini在7个基准上逐项对比,实际支出从便宜53%到贵41%。同一对模型,换一组任务,成本高低便可颠倒。成本随任务而定,评测口径也随之聚焦到“任务”上。

GPT-5.4 mini和DeepSeek V4 Pro在不同基准测试上的端到端成本,仅统计两个模型均能正确解决的任务 来源:CAISI

Intelligence Index v4.1的两个坐标轴,都以“任务”为评测基准。纵轴的Intelligence Index能力指数,衡量的是完成任务的能力,由9个评测加权构成,其中Agents(智能体)占比34%,Coding(编程)占比24%,Scientific Reasoning(科学推理)占比24%,General(通用)占比18%。

Artificial Analysis在方法论页面上明确了评测方向:

the weighting emphasizes agentic tasks
权重向智能体任务倾斜

横轴的每任务成本,取模型跑完整套Intelligence Index的总成本,除以各项评测的任务总数。这笔总成本按input(输入)、cache hit(缓存命中)、cache write(缓存写入)、reasoning(推理)、answer(回答)五类token分别计价,再按各评测在指数中的权重加权。

按这一口径,Claude Opus 4.8 (max)能力得分为56分,每任务成本1.78美元;DeepSeek V4 Pro (max)得44分,0.04美元。

V4 Flash 0731能力得分为50分,高出DeepSeek V4 Pro (max)六分。能力与V4 Flash 0731最接近的是GPT-5.6 Luna (max),得分为51分,高出一分。GPT-5.6 Luna (max)在7月30日下调价格80%,降价之后,V4 Flash 0731的每任务成本仍低约60%。能力最接近的对手降价八成之后,每任务成本仍然更高,凸显了V4 Flash 0731现阶段的性价比优势。散点图中左上方完全空白。

放大器

Agent的应用放大了模型之间的成本差距。一次单轮问答消耗数百至数千tokens,一项Agent任务的tokens消耗量高出数个数量级。模型之间的单价差距不变,最终支出却随消耗量增加而同步扩大。Bai Longju等人在2026年4月的论文《How Do AI Agents Spend Your Money?》(AI智能体如何花掉你的钱)中,分析了八个前沿模型在SWE-bench Verified上的执行轨迹,统计发现Agent编码任务的tokens消耗为代码问答与代码推理的一千倍。

按官方定价,Claude Opus 4.8的输出tokens为每百万25美元,DeepSeek V4 Flash为0.28美元。一次消耗数千tokens的问答,两者的支出差额以美分计。在一项Intelligence Index任务上,Artificial Analysis给出的每任务成本是Claude Opus 4.8 (max) 1.78美元、V4 Flash 0731约0.09美元(推算),支出差额接近1.7美元。模型之间的单价差距没有变化,支出差额由美分级变成美元级。

同时,Agent任务中所消耗的tokens还在快速增长。Artificial Analysis在2026年6月30日的文章《Claude Sonnet 5 Agentic cost》(Claude Sonnet 5的智能体成本)中指出,Sonnet 5的每任务成本为2.29美元,较上一代翻倍,输入输出价格未变,增量全部来自tokens用量增加而非单价上涨。Sonnet 5在Intelligence Index任务上的max档输出tokens较前代高出约40%;在AA-Briefcase和GDPval-AA两项知识工作评测中,智能体轮次约为前代的三倍。消耗量继续上升,在模型上的最终支出也将持续增加。

Agent的应用也放大了模型之间的能力差距,这主要源自Agent任务的步骤数快速增加。单轮问答里,能力差异表现为一次回答的准确率差异。Agent任务由多步骤串联,任一步骤出错,整体即告失败,成功率约等于各步成功率的连乘。一次回答的准确率为95%与90%,相差五个百分点。二十步之后,成功率分别为36%与12%,前者接近后者的三倍。

此外,Agent常设的重试机制进一步放大了两侧差距。失败发生在长任务中途,重跑需重新支付tokens开销,能力不足将直接转化为额外支出。

Agent对模型能力和成本差距的放大效应,直接导致模型分化。性价比落在斩杀线以内的模型,将快速失去市场地位和商业潜力。

模型只是一个部件

Agent给模型的评测带来了更多的变数。

7月,Reddit的r/LocalLLaMA上发表的一篇独立评测,测试者将DeepSeek V4 Flash分别接入Pi、OpenCode、Claude Code、Nanocoder四个Agent,执行同一批真实bug修复任务,并用同一套评分标准。四个框架的能力得分落在同一个重叠区间,但消耗的tokens和时间相差四倍。

单次运行的实际耗时(上)与输出tokens数(下)
来源:nqawhc.github.io

为了有效对比模型的任务执行能力和成本,Artificial Analysis自建并开源了harness Stirrup,这是一个统一的Agent测试框架,E2B沙箱、六个固定工具、250轮上限。所有模型的Intelligence Index跑分都在这个框架里完成。

V4 Flash 0731在Terminal-Bench 2.1这项Agent评测上有两个得分。Artificial Analysis使用Stirrup测得79%,DeepSeek在2026年7月31日更新日志中公布的是82.7%,后者用的是自家DeepSeek Harness的极简模式。

Agent已成为大模型的主流使用场景,单纯的模型能力分数往往不能说明全部问题,真正的能力只存在于系统层级。

二. 毒圈缩圈

没有二等奖

斩杀线意味着斩杀彻底且迅速。一旦落入斩杀范围,模型在市场中往往直接失去竞争力。

大模型的切换成本极低。我在《再谈OpenAI:8000亿的估值,建不起的壁垒》中曾分析过:与苹果等拥有网络效应的业务不同,AI大模型的业务架构完全不同——API调用标准化,操作协议(如MCP)开放,开发者可以多渠道并行触达用户,用户也不知道更不在乎底层模型是谁。开发者可以快速且低成本自由切换模型。

同时,基础模型层的进步已明显放缓,同质化竞争加剧。同一能力档位的模型之间,只要工程配套完备,切换不会带来交付质量的明显下降。

市场份额不随性价比差距线性分配,而是向性价比优者快速聚集。性价比处于劣势的模型,将快速失去商业潜力。

“斩杀线”之内没有二等奖,所有模型厂商都必须勇夺第一。

不是飞轮,是跑步机

即便跟上了,也停不下来。

目前,由于模型优化迭代和硬件升级,tokens成本处于快速下降通道。但降下来的成本在激烈的价格竞争中无法转化为利润。

2026年7月30日,OpenAI在GPT-5.6的页面上追加更新,将GPT-5.6 Luna的价格下调80%,GPT-5.6 Terra下调20%。次日,DeepSeek发布V4 Flash 0731。只要有一家把降本传导为降价,在“毒圈”不断缩小的威胁下,其余厂商不跟进就得交出市场份额。

通过性价比获得的优势可以维持,但难以形成壁垒。我在《再谈OpenAI:8000亿的估值,建不起的壁垒》中的判断同样适用于今天的“毒圈”缩圈竞赛:“以AI大模型业务为基础的全栈协同可以带来成本优势和体验优化,但这种优势不是结构性的封闭高墙,而是需要持续执行力来维持的竞争位势。”OpenAI等大模型厂商“进入的不是一座可以筑墙固守的城池,而是一片需要每天争夺的开阔地。”

OpenAI自己披露的数据是这句判断的注脚:算力从0.2吉瓦增至1.9吉瓦,9.5倍;收入从20亿美元增至200亿以上,10倍。投入与产出几乎线性对应,扩张没有带来单位效率上的额外收益。

这不是飞轮,是跑步机。

终点未至

价格战通常终止于成本。价格降到成本附近,再降即为亏损,竞争被迫停止。

2026年5月23日,DeepSeek将V4 Pro API价格永久降至原定价的四分之一。

证券时报当日报道,降价后每百万tokens输入(缓存命中)0.025元、输入(缓存未命中)3元、输出6元,“创全球大模型价格新低”。

国新证券5月29日的研报进一步拆解了降价的底层来源,V4系列采用混合注意力架构与多token预测技术,单token推理浮点运算量仅为前代的27%,KV缓存大小降至前代的10%。根据Gartner的预测,到2030年,大模型推理成本将较2025年降低超过90%。

路透社在2026年7月援引三位匿名知情人士报道,DeepSeek正在研发自有芯片。该芯片专为推理设计,不用于训练新模型,项目启动于约一年前。OpenAI、Anthropic等头部厂商也早已公布自研芯片计划,通过模型迭代之外的方式进一步降低成本保持性价比优势,是众多模型厂商的主要选择之一。

成本降低是耐力赛,价格战的终点也还在远方。

抬升未止

斩杀线还将继续上移,推力来自模型技术进步和基础设施投入。

模型仍在迭代。V4 Flash 0731的架构与尺寸均未变动,仅重做了后训练,Intelligence Index得分从40升至50,反超自家V4 Pro (max)的44分。

自研芯片、自建算力、应用系统工程化与集成等投入周期长、金额大,具备形成规模壁垒的潜力,一旦转化为模型能力和成本优势,将推动“斩杀线”继续上移。

三. 生死局

“斩杀线”和“毒圈”,这两个词同时在中英文AI圈流行,恰好生动地道出了两层意思:“斩杀线”意味着一旦落后,便失去商业潜力,中间没有过渡地带;“毒圈”意味着仍留在场内的玩家所面临的生死威胁正在加快逼近。

大模型行业竞争已经惨烈到需要用生死类比来描述的程度。

 

参考资料:

  1. Artificial Analysis Changelog|Artificial Analysis
  2. Artificial Analysis Models|Artificial Analysis
  3. Intelligence Benchmarking Methodology|Artificial Analysis
  4. Artificial Analysis Intelligence Index v4.1|Artificial Analysis
  5. CAISI Evaluation of DeepSeek V4 Pro|NIST / CAISI
  6. Claude Sonnet 5 Agentic cost|Artificial Analysis
  7. Stirrup|Artificial Analysis, GitHub
  8. DeepSeek API 更新日志|DeepSeek
  9. DeepSeek API 定价页|DeepSeek
  10. 云涌AI观察|再谈OpenAI:8000亿的估值,建不起的壁垒|云涌AI
  11. GPT-5.6: Frontier intelligencethat scales with your ambition|OpenAI
  12. DeepSeek将V4-Pro API价格永久下调至四分之一|证券时报
  13. DeepSeek永久降价:模型成本曲线重构|国新证券
  14. 消息人士:DeepSeek正研发自有AI芯片|RFI中文(转载路透社报道)
  15. Introducing Claude Opus 4.8|Anthropic
  16. How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks|Bai Longju等,arXiv(2026-04)
  17. DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index|Artificial Analysis
本文系作者 云涌AI 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里

敬原创,有钛度,得赞赏

赞赏支持
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

登录后输入评论内容

扫描下载App