每秒1107 tokens,智能追平GPT-5.6:硅谷无名创企给大模型换了台发动机

2026.09.24 18:39
2026年9月8日,硅谷创企Inception发布Mercury 2.5——全球首款生产级扩散大语言模型(dLLM),推理速度达1107 tokens/s,是同类模型的数倍。其智能水平对标GPT-5.6 Luna、Claude Haiku 4.5等成本优化版前沿模型,首发输入价格仅为$0.04/百万token。本文从技术架构、性能对比和商业逻辑三个维度,拆解这家斯坦福系创企如何用一条没人走通的路改写AI推理的经济学。

2026年9月,大模型行业的发布日历密集到几乎容不下呼吸。三天前,Abu Dhabi的IFM开源了横跨0.9B到375B参数的K2 Horizon系列;前一天,科大讯飞端出了293B参数的Spark X2.5推理大模型;同期,OpenAI的GPT-6 Astra也在逐步上线。而在这一波巨头和准巨头的轮番轰炸中,一家年营收几乎为零、成立不到两年的公司,悄悄投下了一枚技术炸弹。

Mercury 2.5——每秒1107个token,是OpenAI o3的7倍以上,智能水平对标GPT-5.6 Luna和Claude Haiku 4.5。首发价仅为$0.04/百万输入token,比市区一杯美式咖啡还便宜。

但Mercury 2.5真正值得关注的,不是一个速度数字,而是一个结构性问题:当全球排名前20的AI公司全在用同一种方式生成token时,Inception选了另一条路,而且第一次让它看起来像是正确的路。

现象层:一个速度奇迹和一个智能天花板

先看硬数据。

根据Inception官方发布和Artificial Analysis独立评测,Mercury 2.5在NVIDIA通用GPU上达到了每秒1107个token的输出速度。Inception称其为当前生产环境中速度最快的推理模型。

作为参考:Artificial Analysis统计的同类推理模型输出速度中位数约为108.6 tokens/s——Mercury 2.5以770 tokens/s(AA实测)到1107 tokens/s(官方标称)直接将行业均值甩出了一个数量级。Puter的独立测试发现,Mercury 2.5的瞬时生成速率中位数达1241 tokens/s,但单次运行波动很大——从727到1756 tokens/s不等,是测试组中稳定性最差的模型。如果把等待时间也算进去,包括首token延迟,端到端的有效速率约为106 tokens/s。

速度之外,智能是关键。Mercury 2.5在Artificial Analysis Intelligence Index v4.3.2上获得综合评分12分(中位数13分),在4单元量表中位列2分。这个分数放在全行业排名中并不靠前——远低于Claude Fable 5.1的65分、GPT-6 Astra的50+分。但Inception从一开始就没打算和旗舰模型硬碰硬。其官方对标对象是成本优化的前沿模型:GPT-5.6 Luna(输出$1.20/百万token,速度约125 tokens/s)、Claude Haiku 4.5(输出$5.00/百万token,速度约200 tokens/s)、Gemini 3.5 Flash-Lite(输出约$0.50/百万token)。

在这个高性价比中间层的战场上,Mercury 2.5打出了一组对手无法匹配的组合拳:1107 tokens/s的速度、$0.15/百万token(首发价)的输出成本——速度是Luna的8倍以上,输出价格仅为Haiku 4.5的三十分之一。

Inception官方报告相比Mercury 2有40%的智能提升,在Agent任务和长上下文推理上的进步尤为显著。

但有一个数据值得停下来想一想。在AA-Omniscience Accuracy(知识准确性)榜单上,Mercury 2.5得分22.4%,在100多个模型中排名第116位——远低于GPT-5.1的37.7%和Claude Sonnet 4.6的38.6%。这说明它的知识广度和事实性仍是明显短板。

换句话说:Mercury 2.5不是万能的。它在推理和Agent任务上表现不错,但在知识回忆和事实性上远不如传统大模型。这不是一个缺陷——这是一个选择。

分析层

一、技术路线之争:扩散LLM这条没人走通的路

要理解Mercury 2.5,先得理解它为什么能这么快。

几乎所有主流大模型——GPT、Claude、Gemini、Llama、DeepSeek——都是自回归架构。它们生成token的方式是串行的:先预测第一个词,把第一个词喂回模型,再预测第二个词,然后第三个……直到整段文本生成完毕。Inception官方将这种机制形象地描述为打字机。

扩散语言模型(dLLM)则完全不同。它借鉴了Stable Diffusion等图像生成模型的工作原理:先初始化一段完整的噪声文本,然后通过多轮迭代逐步去噪,在每一步同时精炼整个序列。Inception官方的比喻是编辑:同时修改整篇稿件,而不是逐字逐句地写。

这套架构差异带来的后果极其直接——速度不是优化出来的,而是架构决定的。自回归模型的token生成速度受限于串行链路:必须先有token N才能生成token N+1。扩散模型没有这个约束——多步去噪可以充分并行化,GPU利用率远高于自回归推理。这也是为什么Mercury 2.5能做到1107 tokens/s,而同等推理精度的自回归模型往往只有100到200 tokens/s。

但为什么直到2026年才有公司把扩散语言模型做到商业化?答案也很直接:扩散在文本上的质量控制难度远高于图像。图像扩散只需要生成视觉上合理的像素排列——人眼对合理的定义相对宽松。文本则不同:一个错词、一个语法错误、一句逻辑跳跃——读者立即能感知到。扩散LLM在多轮去噪中要同时保证语义连贯性、语法正确性和事实准确性,这在技术上的挑战远比图像生成大得多。

Inception创始人Stefano Ermon是斯坦福大学计算机科学教授,在概率生成模型领域深耕超过15年。2025年11月,Inception完成5000万美元种子轮融资,领投方是Menlo Ventures,参投方包括Microsoft的M12、NVIDIA的NVentures、Snowflake Ventures、Databricks Ventures、Mayfield和Innovation Endeavors——以及Andrew Ng和Andrej Karpathy的个人天使投资。

在种子轮阶段就拿到这样的战投阵容,说明硅谷最聪明的资本赌的不是某一家公司——他们在赌一条全新的技术路线,赌自回归不是最后答案这个判断。

二、商业逻辑:速度不是噱头,是经济模型

如果只是速度快,Mercury 2.5可能只是一个好看的数字。但它的真正价值藏在商业逻辑里。

Inception官方标准定价:输入$0.20/百万token,输出$0.75/百万token——大致处于行业中间水平。但首发折扣价直接把输入压到了$0.04/百万token,输出$0.15/百万token,相当于打2折。

做一个简单的对比:同档位的GPT-5.6 Luna输出价格为$1.20/百万token。Claude Haiku 4.5高达$5.00/百万token。Mercury 2.5首发价$0.15/百万token——仅为后者的三十分之一。

但真正改变经济模型的,是速度带来的复合收益。

考虑一个典型的Agent场景:一次用户查询可能触发5到10次模型调用——查询规划、结果重写、排序、摘要、事实核对。如果每次调用花0.4秒而不是4秒,那么一次用户交互的总延迟从20到40秒压缩到2到4秒。这不仅仅是用户体验的提升——它意味着在同一时间窗口内可以服务更多用户,或者执行更复杂的多步Agent流程。

Inception的客户提供了两个绝佳案例:

OpenCall(AI客服公司)——换用Mercury后,P99响应时间从几分钟降到了1秒,P50从0.4秒降到了0.2秒以下。
Augment Code(代码Agent平台)——将上下文压缩任务迁移到Mercury后,延迟降低了82%,从约150秒降至27秒,成本降低了90%。

这两个客户都不是拿Mercury做聊天——他们做的是AI客服和代码Agent,都是延迟敏感、循环密集的生产负载。在这种场景下,速度直接转化成成本优势和产品壁垒。OpenCall的CEO Oliver Silverstein说得更直接:Mercury是第一个快到来得及接电话的推理模型。

三、竞争格局:不做最强的,只做最快的

Mercury 2.5的定位需要一个精确的坐标图。

在横轴(智能水平)上,它排在GPT-6 Astra、Claude Fable 5.1、Gemini Ultra之下——这些旗舰模型在AA智能指数上得分在40到65分区间,而Mercury 2.5的12分(4单元量表中的2分)显然属于够用但不出众的水平。它真正对标的,是同属高性价比中间层的GPT-5.6 Luna、Claude Haiku 4.5和Gemini 3.5 Flash-Lite。

在纵轴(速度)上,它是这个档位里唯一的异类——其他所有中间层模型都在100到200 tokens/s的区间内挣扎,Mercury 2.5直接跳到了770到1107 tokens/s。

在第三维(成本)上,首发价$0.04/$0.15让它成为同档位中最便宜的选项之一。

这个定位清晰地回答了一个问题:Inception为什么不做最强模型?

答案不是能力问题,而是战略选择。2026年的格局下,GPT-6 Astra、Claude Fable 5.1已经牢牢占据最强模型的心智标签。与其在Anthropic和OpenAI的赛道上正面血拼,不如在一个新维度上建立绝对优势。这个新维度就是:延迟敏感、吞吐优先的高频推理。

这让人联想到NVIDIA当年放弃游戏显卡核心定位、全面转向数据中心和AI计算的战略转折——当旧赛道的头部难以撼动时,最好的策略不是正面硬刚,而是找到一个新维度,在那个维度上做到对手无法追赶。

更重要的是,这个新赛道正在快速膨胀。搜索Agent、语音AI、代码Agent、RAG管道——这些2025到2026年快速爆发的应用场景,无一例外都是延迟敏感的循环调用。500毫秒的响应和4秒的响应,在聊天场景里区别不大,在Agent循环里却是天壤之别。

Inception同步发布的Mercury Voice(TTFT仅170毫秒的语音Agent模型)和Mercury Router(基于dLLM的智能路由系统)两个预览产品,进一步印证了这一战略——它们不是独立的模型产品,而是围绕低延迟推理这个核心能力构建的生态组件。

四、风险与局限:光环下的阴影

但是,Mercury 2.5并非没有问题。

第一个问题是知识事实性。AA-Omniscience Accuracy得分22.4%,在100多个模型中排名第116位。对于需要事实准确性的场景——金融分析、医疗问答、法律研究——这个短板可能是致命性的。

第二个问题是闭源和单一供应商依赖。Mercury 2.5是纯API产品,权重不可获取,且供应商仅Inception一家(通过Baseten和OpenRouter转售)。对于需要私有化部署或数据主权控制的企业客户,这是一条红线。

第三个问题是领域广度有限。Mercury 2.5仅支持文本输入和输出,不支持图像、音频等多模态输入。在2026年多模态已成为标配的市场环境下,这是明显的功能缺失。

第四个问题是市场深度。Inception是一家种子轮公司,尽管有豪华的股东背景,但相比OpenAI、Anthropic、Google等拥有百亿美元级资本和千万级用户的选手,其企业级服务能力、可用性和生态完整性仍有巨大差距。

Ermon在博客中写道:我们的下一个模型已经开始训练,是迄今为止最大的模型,目标是在不牺牲扩散速度和token效率的前提下实现能力上的飞跃。但下一个模型能否解决上述问题,仍是一个悬而未决的问号。

结论/展望

Mercury 2.5的意义不在一款产品本身,而在于它代表的方向:大模型的竞争不再是单一维度的谁更聪明,而是谁能在正确的时间、以正确的成本、做正确的事。

扩散LLM路线如果继续成熟,将对整个AI产业链产生三层冲击。

第一层:推理成本暴跌。如果dLLM能将推理吞吐提升数倍,AI应用的边际成本将大幅下降。这将催生一批原本因推理成本过高而被搁置的应用场景——毫秒级的实时语音对话、穷举式搜索Agent、大规模并行文档处理。

第二层:硬件竞争格局变化。自回归推理的高度串行化特性,促使AWS、Google等大厂自研定制推理芯片(Trainium、TPU)。扩散推理对并行化的天然亲和性,可能让NVIDIA通用GPU重新获得竞争上的优势——有意思的是,NVIDIA正是Inception的投资方之一。

第三层:Agent经济的催化剂。C端Agent的核心瓶颈并非模型智能不足,而是延迟和成本的双重锁定价。一次Agent循环调用N次模型,单次哪怕只花0.5秒也能接受——可一旦N变成30次,加上自回归推理每秒百来token的底速,用户体验断崖下跌。Mercury 2.5的速度让N变成30次时仍然保持在合理延迟范围内。这可能成为Agent从演示走向生产的最后一块短板。

当然,Inception还远未到颠覆的程度。它需要用一款产品和一支数十人的团队,去推倒巨头用万亿参数和十万张GPU构建的护城河。硅谷的共识是,新架构至少还需要一代产品的迭代,才能完成从追平到超越的跨越。

但有一件事已经清晰:大模型不再是自回归的天下。当Inception用5000万美元种子轮和一纸技术论文,做出了可以正面PK万亿参数巨头的产品——那些手握数十亿美元、却还在一行一行地输出token的公司,应该感到后背发凉了。

在过去四年里,几乎所有人都默认自回归就是大模型的标准答案。Mercury 2.5用一种截然不同的方式证明了:标准答案不一定是唯一答案。当巨头们还在用更大的模型、更多的GPU碾压对手时,Inception的故事告诉我们——有时候,换一条路走,比跑得更快更有效。

作品声明:内容由AI生成