124B参数、完全免费:蚂蚁集团Ling-3.0-flash正在改写AI推理的定价规则

2026.07.24 07:21
OpenRouter上出现了一个完全免费的生产级推理模型:蚂蚁集团旗下inclusionAI的Ling-3.0-flash,124B总参数、5.1B激活、0.81秒延迟、99.96%可用率——零成本调用。这不是孤立的促销,而是中国AI产业系统性免费+开源竞争策略的缩影。当推理的边际成本趋近于零,硅谷围绕卖token建立的商业模式还能撑多久?

你敢信?一个124B参数的MoE大模型,在OpenRouter上的标价是——零。

不是试用额度,不是首月免费,不是必须绑信用卡的免费试用。就是零。2026年7月23日,蚂蚁集团旗下inclusionAI在OpenRouter上正式上线了Ling-3.0-flash,一个完全免费的生产级推理模型。5.1B激活参数、262K上下文窗口、0.81秒端到端延迟、99.96%的可用率——这些数字堆在一起,只意味着一件事:大模型推理的定价权,正在被中国厂商推向一个前所未有的临界点。

免费,但绝不是廉价版

先看产品本身。Ling-3.0-flash采用的是Mixture-of-Experts架构,124B总参数中每次推理仅激活5.1B参数,激活参数占比约4%。这个设计哲学指向一个明确的目标:在保持推理质量的同时,将计算成本压到极致。

OpenRouter上的实测数据给出了更直观的答案:端到端延迟0.81秒,吞吐量3 tokens/秒,30天可用率99.96%。这不是一个你凑合着用的免费模型,这是一个可以支撑生产级负载的严肃产品。

更重要的是,这并不是inclusionAI第一次免费。在此之前,Ling-2.6-flash(104B参数、7.4B激活)和Ling-2.6-1T(万亿参数旗舰)同样在OpenRouter上提供了免费入口。inclusionAI正在系统性地将其整个Ling模型家族向开发者社区免费开放,从万亿参数旗舰到高效推理模型,无一例外。

时间线:中国AI的免费化攻势

把时间轴拉长看,这条路径清晰得令人不安。

2025年10月,蚂蚁集团发布Ling 2.0系列。2026年2月,Ling-2.5-1T和Ring-2.5-1T发布,开始在OpenRouter上提供免费入口。2026年4月,Ling-2.6-flash正式开源,采用MIT协议。2026年7月,Ling-3.0-flash以完全免费姿态上线——距离上一代产品仅3个月。

这背后是整个中国AI产业的集体转向。据OpenRouter数据,截至2026年6月,中国起源模型已占平台路由token的46.4%,而美国起源模型占比35.7%。而在2024年底,中国模型的份额还不到2%。2026年7月第一周,中国模型份额甚至一度突破63%。小米、阿里巴巴、MiniMax、DeepSeek、月之暗面——每家公司都在以免费加开源的方式抢夺开发者心智。OpenRouter现在每月处理超过100万亿tokens,相当于每周25万亿,而中国模型贡献了近一半。

免费不是慈善,是战略

在硅谷的传统叙事里,大模型是卖水人的生意——按token收费,赚取推理算力的差价。OpenAI、Anthropic、Google莫不如此。但中国厂商选择了另一条路:用免费获取开发者生态,用生态反哺模型迭代,用开源建立行业标准。

蚂蚁集团有足够的底气走这条路。作为全球最大的金融科技公司之一,支付宝连接超过10亿用户。对于蚂蚁来说,AI模型的货币化路径从来不是卖API调用次数,而是将其嵌入自身的金融、保险、信用评估等业务场景。把Ling系列免费开放,本质上是将研发成本转化为行业影响力,同时通过社区反馈加速模型迭代。

这也解释了为什么Ling系列全部采用MIT协议开源。这不仅仅是一个许可选择,更是一份战略宣言:我们不靠卖模型赚钱,但我们希望全球开发者都使用我们的模型。

124B和5.1B的效率哲学

Ling-3.0-flash的参数配置本身就透露了设计者的深思熟虑。124B总参数、5.1B激活,激活参数占比仅约4%。这种极致的稀疏激活设计,让模型在推理时只需调用极小的计算资源,却保留了124B参数的知识储备。

这种效率优先的设计哲学,与蚂蚁集团长期以来在金融科技领域的成本控制基因一脉相承。在金融场景中,每一笔交易的成本都必须精确到小数点后四位。同样的思维迁移到了AI模型设计上:用最低的算力成本,达成最高的任务完成率。

而免费策略,则让这种效率优势从技术层面延伸到商业层面。当一个模型的质量和性能已经足够好,而价格却为零时,开发者几乎没有任何理由不去尝试。

中国模型正在改写全球AI定价权

2026年上半年的OpenRouter排名变化,讲述了一个比任何benchmark数字都更有说服力的故事。2月,MiniMax M2.5以单周2.45万亿tokens的消耗量登顶,环比增长197%。4月,小米MiMo-V2-Pro以22.3%的市场份额位居第一。同月,阿里Qwen 3.6 Plus以免费预览模式进入前五。

中国模型在OpenRouter上的市场份额从2024年底的不到2%飙升至2026年中期的46%以上,这场增长曲线的斜率几乎垂直。JPMorgan策略师Michael Cembalest在2026年5月的Eye on the Market报告中专门讨论了这一趋势,称其为全球AI产业最被低估的结构性变化。

而inclusionAI的免费策略,将这条曲线又往上推了一个台阶。之前的中国模型虽然便宜,但至少还有价格。Ling-3.0-flash直接把这个数字降到了零。

免费模式的隐性成本

当然,免费模型并非没有代价。OpenRouter上的免费模型通常有请求频率限制(20 RPM,每日50次请求)。深度使用场景中,上下文窗口虽然标称262K,但长文本下的推理质量可能和付费版本存在差异。此外,数据隐私也是一个需要关注的议题——虽然在OpenRouter上数据训练不会被用于模型训练,但开发者需要自行评估合规风险。

但对大多数开发者来说,这些限制在零成本面前变得不那么重要。原型验证、学习实验、小规模部署——这些场景中,免费模型已经足够好。只有当应用进入大规模生产阶段,才需要考虑付费版本或自部署。

这意味着什么

Ling-3.0-flash的免费不是一个孤立的促销行为,它是中国AI产业系统性竞争策略的一个缩影。当硅谷还在争论每百万tokens应该收费几美元时,中国厂商已经用免费加开源重新定义了游戏规则。

对比一下定价差距:DeepSeek V4 Flash每百万输入token仅收费0.14美元,而OpenAI GPT-5.5定价为5美元,价差超过35倍。现在Ling-3.0-flash干脆把这个数字降到了零。

对于全球开发者来说,这是一个前所未有的红利期。2024年,调用一次顶级大模型API还需要为每百万tokens支付数十美元。2026年,你可以免费调用一个124B参数的MoE模型,而且它还在不断进化。

对于硅谷的AI公司来说,这是一个需要认真回应的挑战。如果竞争停留在谁的模型更强这个维度,中国厂商已经证明了自己能跟上。如果竞争升级到谁的生态系统更厚这个维度,那么免费模型就是最有效的获客手段。而如果竞争进入谁的成本更低这个维度,中国厂商的算力成本优势和效率优先的设计哲学,可能让这场竞赛从一开始就失去了悬念。

InclusionAI的Ling-3.0-flash不是第一个免费的大模型,也不会是最后一个。但它的出现,让一个原本模糊的边界变得清晰:当AI推理的边际成本趋近于零,围绕卖token建立的商业模式,还能撑多久?

作品声明:内容由AI生成

快报

更多

16:45

“红霞”将以台风级或强台风级登陆香港至陆丰沿海

16:34

《2026能源产业生态报告》发布,风电光伏装机超越火电

16:15

国家防总提升针对广东的应急响应至Ⅲ级

16:15

今年上半年新疆霍尔果斯口岸进出口货运量创新高

16:10

全球首个“零碳机场”在内蒙古鄂尔多斯建成

15:32

黎巴嫩称以军行动致该国南部发生强烈爆炸

15:24

数字经济交出亮眼成绩单,2025年中国数字产业收入超39万亿元

15:18

台风“红霞”临近,港珠澳大桥桥梁航道实施临时交通管制

15:15

携程集团就行政处罚决定公布十九项整改措施

15:09

奥地利官员:反对为乌克兰加入欧盟开“快速通道”

14:38

大连首推二套房公积金贷款贴息,年内近90城发“房补”

14:11

自然资源部将广东地质灾害防御响应提升至Ⅲ级

14:07

派拉蒙天舞宣布推迟收购华纳兄弟交易

13:44

沙特证实多国联军打击也门胡塞武装

13:23

SK集团与英伟达通过一项涵盖人工智能工厂和下一代内存的5000亿美元以上战略合作项目,进一步扩大战略合作

13:14

三星电子宣布与博通公司签署谅解备忘录,涵盖至2030年价值高达2000亿美元的存储芯片、代工服务和先进封装业务

13:05

VC价格一个多月涨幅超40%,厂商限量供货

12:54

日本连续5天出现“酷暑日”,刷新历史纪录

12:36

也门胡塞武装称打击沙特南部城市

12:33

鸿蒙版微信更新,支持自定义通话铃声