7月23日,蚂蚁集团旗下AI实验室 inclusionAI 放出了一段视频。
视频里,Ling-3.0-flash 从一句提示词出发,调用 Blender MCP,用 Python 写代码、建城市、铺道路、搭摩天楼、设置摄像机路径,最后渲染出一段航拍视频。整个过程一气呵成,没有人工干预。
但这还不是更值得关注的部分。
同一天,美国知名AI研究机构 Nous Research 宣布,Ling-3.0-flash 即日起免费入驻其开源智能体平台 Hermes Agent。24小时后,Ant Ling 创始人转发了这条消息,配文只有一句话:
“我们来用 Ling-3.0-flash 在 Hermes 上做点有趣的东西,把所有的‘记忆’都留下来。”
这句话里的“记忆”,指的是 Hermes 最核心的能力,持久记忆(Persistent Memory)。一个中国金融科技巨头孵化出的 AI 模型,在发布首日就接入了一个 GitHub 上斩获 219,000 星的开源智能体生态。这中间的故事,远比一段 3D 建模视频更值得拆解。
1/12 的参数,100% 的战斗力
先看模型本身。
Ling-3.0-flash 是一个混合专家(MoE)模型,总参数 124B,每次推理只激活 5.1B 参数。这意味着什么?Ant Ling 官方给出的对比最直观:
它的总参数只有自家万亿旗舰模型的 1/8,激活参数更是只有 1/12。但在绝大多数基准测试上,它“匹配或超越了”那款万亿参数旗舰。
这个效率提升的幅度,放在整个行业都极为罕见。过去两年,从 Google Gemini Flash 到 DeepSeek 的系列模型,行业一直在追求“用小模型打大模型”的能力。但 Ling-3.0-flash 的压缩比达到了新的量级。用 5.1B 激活参数去挑战 1T 参数旗舰,换算下来,每 1B 激活参数要承载近 200B 总参数的智力输出。
它是怎么做到的?
关键在于架构。Ling-3.0 采用了原生混合线性注意力机制:KDA(Kimi Delta Attention)和 MLA(Multi-Head Latent Attention)以 5:1 的比例堆叠。KDA 负责精细控制长程记忆,MLA 负责高效计算。同时,MoE 层采用 1/64 专家激活策略,进一步降低推理成本。
这套架构并非凭空而来。KDA 最早由 Moonshot AI 在 Kimi Linear 架构中提出,能将 KV Cache 降低 75%、解码吞吐量提升 6 倍。Ling-3.0 把 KDA 和 MLA 做了 5:1 的混合配比,本质上是在“线性注意力的高效”和“传统注意力的表达力”之间找到了一个更优的平衡点。
结果是一个原生支持 256K 上下文,可扩展至 1M 的模型,专门为生产级智能体推理而设计。在多步工具调用、长程任务执行、多智能体协作等场景下,它能用更少的 token 完成更多工作。
不是模型发布,是生态卡位
如果 Ling-3.0-flash 只是一个跑分好看的模型,这个故事到这就结束了。但真正值得关注的是它在发布首日做了什么:入驻 Nous Hermes。
Hermes Agent 是 Nous Research 在 2026 年 2 月发布的开源自主智能体。截至 2026 年 7 月 23 日,它在 GitHub 上已获得 219,200 多颗星,全球排名第 20,分叉数超过 41,600。它不是一个 IDE 插件,也不是一个聊天机器人封装。它运行在你的服务器上,能接入 Telegram、Discord、Slack、WhatsApp、Signal 等多个平台,具备持久记忆、自动任务调度、子智能体隔离等能力。
用一句话概括:Hermes 是目前开源社区最接近“AI 操作系统”形态的智能体之一。
而 Ling-3.0-flash 在发布当天就进入了这个生态。Nous Research 的公告很直接:“Ling-3.0-flash 现在在 Nous Portal 上免费开放一周。它速度快,专为智能体工作负载而建,编程、搜索、研究、工具使用。”
这在两个层面上意义重大。
第一,对 Ant Ling 来说,这是一次精准的生态卡位。Hermes 的用户群体是开发者、研究者、AI 重度用户,这正是 Ling-3.0-flash 最需要触达的人群。通过免费入驻加首日公告,Ling-3.0-flash 在发布当天就获得了 45,000 多次曝光(仅 Nous Research 单条帖子的浏览量),并直接进入了开发者的智能体工作流。
第二,对整个行业来说,这是一个信号:中国 AI 模型正在主动嵌入全球开源智能体生态。过去,中国模型厂商的出海路径主要是 API 调用(如 DeepSeek 通过 OpenRouter 提供服务)或开源模型下载(如 Qwen 系列在 HuggingFace 上的分发)。但 Ling-3.0-flash 选择了更深度的一步,不是作为一个“可调用的 API”,而是作为一个“可嵌入智能体工作流的原生模型”。
Ant Ling 创始人那句“keep all the good memories”,精准地指向了 Hermes 的持久记忆功能。Ling-3.0-flash 的 256K 上下文窗口搭配混合注意力架构,让它天然适合处理需要长期记忆的智能体任务,这正是 Hermes 的核心使用场景。
免费策略背后的商业逻辑
Ling-3.0-flash 目前采用激进的免费策略:在 OpenRouter 上免费到 8 月 3 日,在 Nous Portal 上免费一周,在 Kilo 平台上同样限时免费。
这不是慈善。这是典型的企业级模型获客漏斗。
第一步:免费开放,让开发者低成本试用,快速积累口碑和用例。第二步:通过平台 API 调用量数据,锁定高频用户和高价值场景。第三步:免费期结束后,按使用量收费,完成商业转化。
这套策略在 AI 行业已经屡见不鲜。OpenAI 早期对 ChatGPT 的免费开放、DeepSeek 的超低价 API、Google Gemini Flash 的慷慨免费额度,都是同一逻辑。但 Ling-3.0-flash 的免费策略有一个独特之处:它同时覆盖了多个分发渠道(OpenRouter、Nous Portal、Kilo),而不是只依赖单一入口。
这意味着 inclusionAI 不是在“卖模型”,而是在“铺设基础设施”。通过让模型出现在开发者日常使用的每一个平台上,它变成了开发者工作流中默认的选项之一。当免费期结束,开发者已经习惯了用它来跑智能体任务,转换成本就出现了。
对于背靠蚂蚁集团的 inclusionAI 来说,这种“先免费后收费”的耐心是可持续的。蚂蚁集团 2025 年总营收约 2700 亿元人民币,AI 实验室的投入属于战略性亏损。它不需要在第一天就盈利,它需要的是生态位。
效率竞赛:AI 产业进入“Token 经济学”时代
Ling-3.0-flash 的发布,放在更大的行业背景下来看,是 AI 产业从“参数竞赛”到“效率竞赛”转型的最新注脚。
2023 到 2024 年,行业还在追逐“更大”:更大规模的参数、更长的训练时间、更多的 GPU。GPT-4、Claude 3、Gemini Ultra 等模型都在比拼谁的总参数更多、谁在基准测试上更高一分。
2025 到 2026 年,风向变了。MoE 架构成为主流,混合注意力机制开始普及,行业共识从“谁更强”转向“谁更省”。
Ling-3.0-flash 把这场效率竞赛推到了一个新的高度。124B 总参数、5.1B 激活参数,就敢说“匹配或超越”万亿参数旗舰。无论这个“匹配”在绝对意义上打了多少折扣,它都在向市场传递一个清晰的信号:参数规模不再是衡量模型能力的核心指标。
这对整个产业链的影响是深远的。
对于开发者,这意味着更低的推理成本。Ling-3.0-flash 的 MoE 架构加混合注意力,让每次推理的计算量大幅降低。在 OpenRouter 上,它的有效价格(考虑缓存折扣后)比标价低 60% 到 80%。对于需要频繁调用模型的多智能体系统来说,这可能是成本从“不可接受”降到“可接受”的关键转折。
对于云服务商,这意味着推理芯片的选型逻辑可能改变。如果 5.1B 激活参数就能覆盖大部分生产级场景,那么推理端对高端 GPU 的依赖度会下降,更多推理任务可以运行在成本更低的芯片上。
对于模型厂商之间的竞争,这意味着“效率”本身正在成为新的护城河。谁能用更少的计算资源,在更长的上下文窗口上,完成更复杂的多步推理,谁就能在下一阶段的市场中占据优势。
风险与不确定
当然,Ling-3.0-flash 的故事并非没有阴影。
第一,“匹配或超越”的基准测试范围并未完整披露。Ant Ling 官方展示的 benchmark 图表中,部分指标确实领先,但并非所有维度都优于万亿旗舰。在需要深度推理的复杂任务上,5.1B 激活参数是否真的能覆盖 1T 参数的智力密度,仍然是一个需要独立验证的问题。
第二,免费期后的定价尚未公布。如果 Ling-3.0-flash 的商用价格不具竞争力,免费期间积累的开发者好感度可能迅速流失。
第三,inclusionAI 作为蚂蚁集团旗下的实验室,其模型在海外市场的合规性仍需关注。涉及金融科技背景的中国 AI 模型在西方市场的推广,可能面临监管审查。
但所有这些不确定性,都不会改变一个已经发生的事实:一个由中国金融科技巨头孵化的 AI 模型,以 5.1B 激活参数实现了接近万亿参数水平的性能,并在发布首日就嵌入了全球最活跃的开源智能体生态。
这是一个信号。
当中国 AI 不再只是“追赶”,而是用 1/12 的算力打出平局,并主动嵌入全球工具链,这场竞赛的剧本,已经变了。






快报