1/12参数打出平局,蚂蚁Ling-3.0-flash闪电入驻Hermes

2026.07.24 18:29
Ling-3.0-flash是蚂蚁集团inclusionAI发布的一款124B参数MoE模型,仅5.1B激活参数即可匹配万亿旗舰性能。更值得关注的是,它在发布首日即入驻Nous Research的Hermes Agent生态,成为中国AI深度嵌入全球开源智能体工具链的标志性事件。

7月23日,蚂蚁集团旗下AI实验室 inclusionAI 放出了一段视频。

视频里,Ling-3.0-flash 从一句提示词出发,调用 Blender MCP,用 Python 写代码、建城市、铺道路、搭摩天楼、设置摄像机路径,最后渲染出一段航拍视频。整个过程一气呵成,没有人工干预。

但这还不是更值得关注的部分。

同一天,美国知名AI研究机构 Nous Research 宣布,Ling-3.0-flash 即日起免费入驻其开源智能体平台 Hermes Agent。24小时后,Ant Ling 创始人转发了这条消息,配文只有一句话:

“我们来用 Ling-3.0-flash 在 Hermes 上做点有趣的东西,把所有的‘记忆’都留下来。”

这句话里的“记忆”,指的是 Hermes 最核心的能力,持久记忆(Persistent Memory)。一个中国金融科技巨头孵化出的 AI 模型,在发布首日就接入了一个 GitHub 上斩获 219,000 星的开源智能体生态。这中间的故事,远比一段 3D 建模视频更值得拆解。

1/12 的参数,100% 的战斗力

先看模型本身。

Ling-3.0-flash 是一个混合专家(MoE)模型,总参数 124B,每次推理只激活 5.1B 参数。这意味着什么?Ant Ling 官方给出的对比最直观:

它的总参数只有自家万亿旗舰模型的 1/8,激活参数更是只有 1/12。但在绝大多数基准测试上,它“匹配或超越了”那款万亿参数旗舰。

这个效率提升的幅度,放在整个行业都极为罕见。过去两年,从 Google Gemini Flash 到 DeepSeek 的系列模型,行业一直在追求“用小模型打大模型”的能力。但 Ling-3.0-flash 的压缩比达到了新的量级。用 5.1B 激活参数去挑战 1T 参数旗舰,换算下来,每 1B 激活参数要承载近 200B 总参数的智力输出。

它是怎么做到的?

关键在于架构。Ling-3.0 采用了原生混合线性注意力机制:KDA(Kimi Delta Attention)和 MLA(Multi-Head Latent Attention)以 5:1 的比例堆叠。KDA 负责精细控制长程记忆,MLA 负责高效计算。同时,MoE 层采用 1/64 专家激活策略,进一步降低推理成本。

这套架构并非凭空而来。KDA 最早由 Moonshot AI 在 Kimi Linear 架构中提出,能将 KV Cache 降低 75%、解码吞吐量提升 6 倍。Ling-3.0 把 KDA 和 MLA 做了 5:1 的混合配比,本质上是在“线性注意力的高效”和“传统注意力的表达力”之间找到了一个更优的平衡点。

结果是一个原生支持 256K 上下文,可扩展至 1M 的模型,专门为生产级智能体推理而设计。在多步工具调用、长程任务执行、多智能体协作等场景下,它能用更少的 token 完成更多工作。

不是模型发布,是生态卡位

如果 Ling-3.0-flash 只是一个跑分好看的模型,这个故事到这就结束了。但真正值得关注的是它在发布首日做了什么:入驻 Nous Hermes。

Hermes Agent 是 Nous Research 在 2026 年 2 月发布的开源自主智能体。截至 2026 年 7 月 23 日,它在 GitHub 上已获得 219,200 多颗星,全球排名第 20,分叉数超过 41,600。它不是一个 IDE 插件,也不是一个聊天机器人封装。它运行在你的服务器上,能接入 Telegram、Discord、Slack、WhatsApp、Signal 等多个平台,具备持久记忆、自动任务调度、子智能体隔离等能力。

用一句话概括:Hermes 是目前开源社区最接近“AI 操作系统”形态的智能体之一。

而 Ling-3.0-flash 在发布当天就进入了这个生态。Nous Research 的公告很直接:“Ling-3.0-flash 现在在 Nous Portal 上免费开放一周。它速度快,专为智能体工作负载而建,编程、搜索、研究、工具使用。”

这在两个层面上意义重大。

第一,对 Ant Ling 来说,这是一次精准的生态卡位。Hermes 的用户群体是开发者、研究者、AI 重度用户,这正是 Ling-3.0-flash 最需要触达的人群。通过免费入驻加首日公告,Ling-3.0-flash 在发布当天就获得了 45,000 多次曝光(仅 Nous Research 单条帖子的浏览量),并直接进入了开发者的智能体工作流。

第二,对整个行业来说,这是一个信号:中国 AI 模型正在主动嵌入全球开源智能体生态。过去,中国模型厂商的出海路径主要是 API 调用(如 DeepSeek 通过 OpenRouter 提供服务)或开源模型下载(如 Qwen 系列在 HuggingFace 上的分发)。但 Ling-3.0-flash 选择了更深度的一步,不是作为一个“可调用的 API”,而是作为一个“可嵌入智能体工作流的原生模型”。

Ant Ling 创始人那句“keep all the good memories”,精准地指向了 Hermes 的持久记忆功能。Ling-3.0-flash 的 256K 上下文窗口搭配混合注意力架构,让它天然适合处理需要长期记忆的智能体任务,这正是 Hermes 的核心使用场景。

免费策略背后的商业逻辑

Ling-3.0-flash 目前采用激进的免费策略:在 OpenRouter 上免费到 8 月 3 日,在 Nous Portal 上免费一周,在 Kilo 平台上同样限时免费。

这不是慈善。这是典型的企业级模型获客漏斗。

第一步:免费开放,让开发者低成本试用,快速积累口碑和用例。第二步:通过平台 API 调用量数据,锁定高频用户和高价值场景。第三步:免费期结束后,按使用量收费,完成商业转化。

这套策略在 AI 行业已经屡见不鲜。OpenAI 早期对 ChatGPT 的免费开放、DeepSeek 的超低价 API、Google Gemini Flash 的慷慨免费额度,都是同一逻辑。但 Ling-3.0-flash 的免费策略有一个独特之处:它同时覆盖了多个分发渠道(OpenRouter、Nous Portal、Kilo),而不是只依赖单一入口。

这意味着 inclusionAI 不是在“卖模型”,而是在“铺设基础设施”。通过让模型出现在开发者日常使用的每一个平台上,它变成了开发者工作流中默认的选项之一。当免费期结束,开发者已经习惯了用它来跑智能体任务,转换成本就出现了。

对于背靠蚂蚁集团的 inclusionAI 来说,这种“先免费后收费”的耐心是可持续的。蚂蚁集团 2025 年总营收约 2700 亿元人民币,AI 实验室的投入属于战略性亏损。它不需要在第一天就盈利,它需要的是生态位。

效率竞赛:AI 产业进入“Token 经济学”时代

Ling-3.0-flash 的发布,放在更大的行业背景下来看,是 AI 产业从“参数竞赛”到“效率竞赛”转型的最新注脚。

2023 到 2024 年,行业还在追逐“更大”:更大规模的参数、更长的训练时间、更多的 GPU。GPT-4、Claude 3、Gemini Ultra 等模型都在比拼谁的总参数更多、谁在基准测试上更高一分。

2025 到 2026 年,风向变了。MoE 架构成为主流,混合注意力机制开始普及,行业共识从“谁更强”转向“谁更省”。

Ling-3.0-flash 把这场效率竞赛推到了一个新的高度。124B 总参数、5.1B 激活参数,就敢说“匹配或超越”万亿参数旗舰。无论这个“匹配”在绝对意义上打了多少折扣,它都在向市场传递一个清晰的信号:参数规模不再是衡量模型能力的核心指标。

这对整个产业链的影响是深远的。

对于开发者,这意味着更低的推理成本。Ling-3.0-flash 的 MoE 架构加混合注意力,让每次推理的计算量大幅降低。在 OpenRouter 上,它的有效价格(考虑缓存折扣后)比标价低 60% 到 80%。对于需要频繁调用模型的多智能体系统来说,这可能是成本从“不可接受”降到“可接受”的关键转折。

对于云服务商,这意味着推理芯片的选型逻辑可能改变。如果 5.1B 激活参数就能覆盖大部分生产级场景,那么推理端对高端 GPU 的依赖度会下降,更多推理任务可以运行在成本更低的芯片上。

对于模型厂商之间的竞争,这意味着“效率”本身正在成为新的护城河。谁能用更少的计算资源,在更长的上下文窗口上,完成更复杂的多步推理,谁就能在下一阶段的市场中占据优势。

风险与不确定

当然,Ling-3.0-flash 的故事并非没有阴影。

第一,“匹配或超越”的基准测试范围并未完整披露。Ant Ling 官方展示的 benchmark 图表中,部分指标确实领先,但并非所有维度都优于万亿旗舰。在需要深度推理的复杂任务上,5.1B 激活参数是否真的能覆盖 1T 参数的智力密度,仍然是一个需要独立验证的问题。

第二,免费期后的定价尚未公布。如果 Ling-3.0-flash 的商用价格不具竞争力,免费期间积累的开发者好感度可能迅速流失。

第三,inclusionAI 作为蚂蚁集团旗下的实验室,其模型在海外市场的合规性仍需关注。涉及金融科技背景的中国 AI 模型在西方市场的推广,可能面临监管审查。

但所有这些不确定性,都不会改变一个已经发生的事实:一个由中国金融科技巨头孵化的 AI 模型,以 5.1B 激活参数实现了接近万亿参数水平的性能,并在发布首日就嵌入了全球最活跃的开源智能体生态。

这是一个信号。

当中国 AI 不再只是“追赶”,而是用 1/12 的算力打出平局,并主动嵌入全球工具链,这场竞赛的剧本,已经变了。

作品声明:内容由AI生成

快报

更多

16:45

“红霞”将以台风级或强台风级登陆香港至陆丰沿海

16:34

《2026能源产业生态报告》发布,风电光伏装机超越火电

16:15

国家防总提升针对广东的应急响应至Ⅲ级

16:15

今年上半年新疆霍尔果斯口岸进出口货运量创新高

16:10

全球首个“零碳机场”在内蒙古鄂尔多斯建成

15:32

黎巴嫩称以军行动致该国南部发生强烈爆炸

15:24

数字经济交出亮眼成绩单,2025年中国数字产业收入超39万亿元

15:18

台风“红霞”临近,港珠澳大桥桥梁航道实施临时交通管制

15:15

携程集团就行政处罚决定公布十九项整改措施

15:09

奥地利官员:反对为乌克兰加入欧盟开“快速通道”

14:38

大连首推二套房公积金贷款贴息,年内近90城发“房补”

14:11

自然资源部将广东地质灾害防御响应提升至Ⅲ级

14:07

派拉蒙天舞宣布推迟收购华纳兄弟交易

13:44

沙特证实多国联军打击也门胡塞武装

13:23

SK集团与英伟达通过一项涵盖人工智能工厂和下一代内存的5000亿美元以上战略合作项目,进一步扩大战略合作

13:14

三星电子宣布与博通公司签署谅解备忘录,涵盖至2030年价值高达2000亿美元的存储芯片、代工服务和先进封装业务

13:05

VC价格一个多月涨幅超40%,厂商限量供货

12:54

日本连续5天出现“酷暑日”,刷新历史纪录

12:36

也门胡塞武装称打击沙特南部城市

12:33

鸿蒙版微信更新,支持自定义通话铃声