“Oh no, oh no, no, no. This brings back old memories.”
7月24日下午,AI 圈知名 KOL Chubby♨️ 在 X 上发出了这条推文。配图是一张基准测试截图——Anthropic 刚刚发布的 Claude Opus 5,在几乎所有评测维度上都逼近甚至超越了七周前才登顶的旗舰模型 Fable 5。
对熟悉这个行业的人来说,这确实像一段旧记忆的闪回。2025年11月,Anthropic 用 Opus 4.5 的 67% 降价震撼市场;2026年6月9日,Fable 5 以 $10/$50 每百万 token 的定价把能力天花板再一次推高。但仅仅七周后,Opus 5 就以 Fable 5 一半的价格——$5/$25——交出了一份几乎同样亮眼的成绩单。
这不是新王登基的故事。恰恰相反,这是一个关于聪明人停止内卷的故事。
半价逼近旗舰
在 Frontier-Bench v0.1 上,Opus 5 以 43.3% 超越所有已知模型,包括 Fable 5,同时将 Opus 4.8 的得分翻了一倍以上,单任务成本反而更低。在 CursorBench 3.2 上,Opus 5 在最高努力模式下与 Fable 5 的峰值得分差距仅为 0.5%,成本只有后者的一半。
更令人瞠目的是 ARC-AGI-3 测试——一个被广泛认为衡量类人推理能力的基准。Opus 5 拿下 30.2%,而 OpenAI 最新的 GPT-5.6 Sol 仅得 7.8%。作为参考,Opus 4.8 此前只有 1.5%。ARC Prize 官方账号在 X 上发文称,Opus 5 在测试中展现了前所未有的行为,将 25 个任务中的 5 个从前从未被任何模型攻克的任务一举拿下。
“Holy cow!!” Chubby♨️ 在另一条推文中写道。评论区有人调侃——在 Sol 的得分柱上,那不起眼的灰色色块,几乎让人不忍直视。
精明的分层游戏
Opus 5 的定价揭示了一个精密计算的商业逻辑。Anthropic 的产品线已形成清晰的金字塔:Haiku 4.5($1/$5)→ Sonnet 5($3/$15)→ Opus 5($5/$25)→ Fable 5($10/$50)。每个层级恰好为上一级的 1.5 到 2 倍。
但 Fable 5 有一个致命问题:它太贵了,而且太稀缺了。Fable 5 仅在 Claude Max 的 $100/$200 订阅层级中可用,且受到严格的使用限制。美国政府已在 6 月以国家安全为由,限制了外国对 Mythos 和 Fable 的访问,潜在客户群被大幅收窄。
Opus 5 的战略价值正在于此。它没有数据保留政策——Anthropic 不存储 Opus 5 的提示数据,价格只有 Fable 5 的一半,在编码和知识工作评测上却与之不相上下。对于企业客户来说,这几乎是一个不需要犹豫的选择。
翻译成商业语言:Fable 5 是实验室里的超级跑车,Opus 5 是每天通勤的豪华轿车。前者为你赢得 Benchmark 排行榜,后者为你赚钱。
安全的选择性取舍
在网络安全等高危能力上,Anthropic 明确表示 Opus 5 不是行业最佳——这一位置仍然属于 Mythos 5。Anthropic 有意不在 Opus 5 上训练网络安全任务。这意味着 Opus 5 在编写漏洞利用代码方面表现平平,但在漏洞检测方面已接近 Mythos 5 的水平。
根据 DevelopersIO 的报道,Opus 5 的安全分类器触发频率预计比 Fable 5 低约 85%,意味着被拒绝的请求更少,用户体验更流畅。
在生命科学领域,Opus 5 全面超越了 Opus 4.8:分子结构推断能力提升 10.2 个百分点,蛋白质功能预测提升 7.7 个百分点。Anthropic 在博客中强调,Opus 5 在验证自己的工作并仔细迭代直到成功方面,比以往任何模型都强得多。这指向了一个关键的技术进步方向——不再追求一步到位的正确答案,而是通过反复自我验证来逼近最优解。
GPT-5.6 Sol 的阴影
Opus 5 的发布时机绝非偶然。7月9日,OpenAI 发布了 GPT-5.6 系列,Sol 模型在 Artificial Analysis 智能指数上得分 59,仅比 Fable 5 的 60 低一分,在 Coding Agent 指数上以 80 分登顶。Sol 定价 $5/$30,与 Opus 5 的 $5/$25 直接对位。
在 DeepSWE 基准上,Sol 以 73% 的 pass@1 领先 Fable 5 的 70%。但在 ARC-AGI-3 上,Opus 5 以 30.2% 对 7.8% 的悬殊比分碾压 Sol。这反映出两个模型在推理能力上的根本性差异——Sol 擅长代码执行,Opus 5 擅长抽象推理。
这场竞争已经不再是“谁更聪明”的问题,而是“谁更便宜、更可靠、更实用”的问题。Opus 5 和 Sol 双双把价格定在 $5/$25-$30 区间,这个价位恰好是此前 Sonnet 级别的定价。行业竞争的价格基准正在被系统性下移。
从最强模型到最佳日常模型
Opus 5 的发布标志着 AI 行业竞争逻辑的根本性转变。过去三年,实验室的竞争逻辑是“我的最强模型比你的更强”。Opus、GPT-4、Gemini Ultra——每一代都在争夺“最聪明”的称号。
但 2026 年的市场已经变了。企业客户不再关心模型在 MMLU 上高了多少分,他们在意的是:每解决一个真实任务要花多少钱?模型是否稳定可用?数据安全是否有保障?CNBC 在报道中援引分析人士的观点:企业越来越不愿意在看不到清晰 ROI 的情况下尝试昂贵的模型。
Opus 5 的回应直截了当:以 Opus 4.8 的价格,提供接近 Fable 5 的性能。在 Frontier-Bench 上,Opus 5 的成本效率是所有模型中最好的。
这背后是 Anthropic 对“规模化”的重新理解。过去,Scaling Law 意味着更大、更多数据、更多算力;现在,Scaling Law 意味着更多用户、更多任务、更多实际收入。Opus 5 的定价策略不是为了打赢 Benchmark 战争,而是为了扩大可自动化任务的漏斗——每一个在 Opus 4.8 上边际成本过高的任务,在 Opus 5 上都变得经济可行,而每一个可行的任务,都是持续的 Token 收入。
结论
这并不意味着 Fable 5 失去了意义。在那些真正需要天花板级能力的场景——前沿科研、高难度安全分析、复杂系统设计——Fable 5 和 Mythos 5 仍然不可替代。但问题在于,这样的场景在整个 AI 应用市场中占比可能不到 5%。
余下 95% 的场景——代码生成、文档处理、数据分析、客户支持、自动化工作流——需要的不是最聪明的模型,而是足够聪明且足够便宜的模型。Opus 5 正是为这个 95% 的市场而生。
Anthropic 还推出了两个 Beta 功能:对话中切换工具不再需要清空缓存,以及 API 自动回退路由。Opus 5 还提供 Fast 模式,以 2 倍价格换取约 2.5 倍的速度。这些功能对 Agent 开发者而言,比任何 Benchmark 都更有价值。
但 Opus 5 也面临悬而未决的问题:效率优势能否在生产环境中复现,而非仅仅停留在 Benchmark 上?企业客户是否愿意接受安全分类器有时候替用户做决定——即使触发频率降低了 85%,原则问题仍然存在?
更深层的信号是:AI 行业的重心已经转移。过去三年,实验室竞争的是最强模型在最好的一天能做什么。Opus 5 告诉我们,新的竞争逻辑是一个非常好的模型在每一天都能做什么,而且只收一半的钱。
在一个不断向前移动的赛道上,Anthropic 赌的是:真正的财富,恰恰就在后方不远处等着。






快报