2026年9月2日,Meta Platforms在没有任何预热的情况下,悄然上线了Muse Spark 1.3。这支被Meta首席AI官Alexandr Wang称为“编码能力超越GPT-5.6 Sol,与Claude Fable 5.1持平”的模型,不是一次简单的点版本更新。它是Meta在大模型竞赛中下的一步偏离主路的棋。在所有人都盯着纯能力排行榜的时候,Meta选择了一个截然不同的战场:效率。
Muse Spark 1.3通过Meta Model API和Muse Code同步开放。根据AI at Meta官方公告披露,新一代模型的核心改进集中在四个维度:长周期智能体任务、实时协作能力、多任务处理、以及编码效率。其中两个数字可能比任何benchmark分数都更有杀伤力——工具调用减少约20%,token消耗减少约25%。
在定价端,Muse Spark 1.3沿用了从1.1开始的定价结构:每百万输入token 1.25美元、缓存命中0.15美元、输出4.25美元。对比来看,Claude Fable 5.1的输入/输出价约为10美元和50美元,GPT-5.6 Sol为5美元和30美元。Meta的定价大约是Anthropic高端模型的十分之一到五分之一,是OpenAI高端模型的四分之一到三分之一。
更值得注意的是定价从未上涨。从1.1到1.2再到1.3,Meta保持了完全相同的价格。这在2026年大模型集体涨价的趋势中,显得异常另类。
根据Investing.com等多家外媒报道,Muse Spark 1.3在MRCR 256K到512K长上下文理解测试中拿到98.5分,在MRCR 512K到1M拿到98.1分,均为该对比组最高水平。在DeepSWE v1.1编码测试中拿到75.4分,领先于GPT-5.6 Sol的64.6%以及Opus 5的对应分数。Terminal-Bench 2.1上拿到88.8分,与GPT-5.6的该测试结果持平。
与此同时,Meta官方确认Muse Spark 1.3将逐步集成至Instagram、Facebook及Meta AI助手。近40亿的月活用户池,将成为这套AI能力的天然放大器。Meta还预告了后续更大的“Watermelon”模型以及开放权重版本,暗示这条路线并非终点。
当所有人拼上限时,Meta拼下限
2026年的前沿大模型竞赛已经陷入一种军备式内卷。每个新版本都在benchmark排行榜上冲高零点几个百分点,但API价格也在同步上涨。Claude Opus 4.8的定价是每百万输出token 15美元,到了Fable 5直接跳到50美元。GPT-5.6 Sol的30美元输出价同样比前代大幅提升。模型更强了,但使用成本也在指数级增长。
这就引出一个结构性矛盾。如果你的智能体每跑一个长周期任务就要消耗数万甚至数十万token,按Claude Fable 5.1或GPT-5.6 Sol的定价算下来,一个中等规模企业级Agent项目每月仅API调用的成本就能轻松突破数万美元。
Muse Spark 1.3的“减工具调用20%、减token消耗25%”听起来不像技术突破,但在商业上的杀伤力远大于benchmark进步。它直接回答了那些正在部署AI Agents的企业最核心的焦虑:我到底要为这个智能体花多少钱?
Meta押注的是:当模型能力差距缩小到一定范围后,开发者会优先选择“够用且便宜”的方案,而不是“最强但昂贵”的方案。
Meta押对了Agent赛道
2026年AI行业最大的趋势之一,是AI从一问一答的聊天模式转向能自主完成多步骤复杂任务的Agent模式。传统API调用模式下,一次对话消耗的token通常只有几百到几千。但AI Agent在推理、检索工具、调用外部API、返回结果再推理之间不断循环,一个完整的工作流可能需要数十轮交互,token消耗轻松突破数万。
这就引出了问题:token效率不仅仅是成本问题,还是性能问题。token预算越高,agent响应越慢。工具调用越多,失败概率越大。
Muse Spark 1.3的定位精准击中了这个痛点。它内置了三种Agent化原生能力:长周期任务中自主生成上下文、根据冲突来源自我纠正规划、实时协作时主动确认执行。这些都是模型级别的原生能力,而非外挂一个编排框架。
Meta的策略是“省token省在刀背上”——在模型能力接近的前提下,让每一个token和每一次工具调用都产生更高回报。当其他模型还在为自己能做什么而骄傲时,Muse Spark 1.3更关心的是你做事的过程中花了多少钱。
算力自给自足带来的定价权
Muse Spark 1.3能定出1.25美元和4.25美元的价格,不是因为Meta不想赚钱,而是因为它有能力不按市场溢价定价。
原因来自两个维度。第一,Meta拥有全球领先的自建计算基础设施。据行业报道,扎克伯格曾披露Meta在AI基础设施上的资本支出规模达到数百亿美元量级,直逼甚至超过微软、谷歌和亚马逊的同期投入。第二,Meta的AI商业化逻辑与OpenAI和Anthropic本质不同。后者的商业模式完全依赖API收入,而Meta有Instagram、Facebook、WhatsApp等超级流量产品作为AI能力的落地场景,API只是其AI投资的一个回收渠道,而非唯一命脉。
这让Meta可以接受更低的API毛利率。对比之下,OpenAI和Anthropic必须用API收入来覆盖训练和推理成本。Meta的API更像是开发者生态的引流工具——先用低价吸引开发者试用,再用产品级整合来放大价值。
用华尔街的话说,Meta不仅有护城河,还有定价权——不是能定价更高的权力,而是能定价更低的权力。
竞争格局:Meta在AI战役中的角色
2026年的AI市场格局呈金字塔形。顶部是OpenAI的GPT-5.6系列和Anthropic的Claude Fable 5和5.1,中间层包括Google Gemini、Meta Muse Spark、xAI Grok,底层是大量开源和垂直模型。就在Muse Spark 1.3发布的前后脚,Google也在酝酿Gemini 3.8 Flash——一款同周上线的编码强化模型,意图缩小与Anthropic和OpenAI之间的差距。
在这个格局下,Meta选择了一条与Llama开源路线完全相反的路径——Muse Spark是闭源商业模型。但它同时承诺后续发布开放权重的Muse Spark版本,并预告了代号“Watermelon”的更大规模模型,试图兼顾开源社区的期待和高端场景的覆盖。
这背后的逻辑与定价策略一脉相承。Meta不指望Muse Spark成为所有维度上的最强,但希望它成为在关键场景中以最具性价比的方式兑现能力的模型。用低价API吸引开发者生态,用社交产品矩阵承接C端流量,用开放权重安抚开源社区——三条腿同时走路,比单纯在benchmark上争第一要聪明得多。
当然,风险也同样明确。在高端应用中,如果用户不在乎成本,Muse Spark 1.3的能力上限是否真的能与Fable 5.1全面对标?Wang所说的“编码能力持平Fable 5.1”是一个有前提的表述。根据BenchLM的评测对比,Muse Spark 1.3在DeepSWE上确实领先多数对手,但在更广泛的能力评测中仍有未被覆盖的领域。这不是一个全面超越的故事,这是一个够用且便宜的故事。
从最强到最值得用
Muse Spark 1.3的意义不在benchmark分数本身,而在它揭示了AI市场竞争正在进入下一个阶段——从“谁的模型更强”转向“谁的模型更省”。当模型足够好,价格就成了决定因素。
Meta的策略很清晰:用近40亿用户的社交生态势能,辅以远低于对手的API定价,将Muse Spark打造成覆盖最广的AI模型——不一定是每个维度上最强的,但是在最多场景中最具性价比的。如果这个策略奏效,Meta将在OpenAI和Anthropic的夹击中找到第三条路。
对开发者而言,这是一个明确的信号:在Agent应用立项时,不必再只盯着顶部的模型。先问问自己,你的智能体每跑一次任务,要花掉多少钱?
这不是一个让人愉快的问题。但这是Muse Spark 1.3提醒每一个AI应用开发者必须面对的问题。
一个时代正在过去。AI的竞争不再是“谁最强”的竞赛,而是“谁最值得用”的竞赛。而当这个问题开始主导市场,Meta手里的牌,比任何人想象的都要好。






快报