文章详情顶部

中国模型,全球底座

AGI
中国大模型,正在悄悄成为全球AI的水电煤。

文 | 字母榜

中国大模型被“套壳”,现在已经不是新闻了,这不,前几天又爆出来一个。

9月2日,沙特AI公司HUMAIN发布了HUMAIN M3模型,发布之初,官方直接宣称这是“100% Saudi Model”(100% 沙特模型)。

虽说这个公司的名字可能对于我们来说有些陌生,但是M3这个字眼格外很眼熟,毕竟MiniMax才发布MiniMax M3没过去多久。

再加上其428B总参数,23B激活参数的配置跟MiniMax M3完全相同。于是评论区很快就有人质疑:100%沙特?

发布者苏丹·阿尔法伊菲(Sultan Alfaifi)随后不得不亲自澄清,称HUMAIN M3是基于MiniMax旗下的M3开发的。

然而这件事放在中国AI上并非偶然事件,日本乐天用DeepSeek、新加坡国家人工智能计划用Qwen……中国的模型已悄然成为了全球AI开发者的首选。

以前中国大模型出海,更多是卖API、卖产品,赚的是调用费和服务费。现在,它们正以一种全新的形态出击。

是好是坏暂且不论,但毫无疑问,这是开源模型真正开始向外扩散的信号。

01

HUMAIN其实并不缺自己的模型。

2025年8月,这家由沙特主权财富基金组建的国家级AI公司,刚刚发布过ALLaM 34B,120多名AI专家、35名博士参与,在沙特境内从零训练,主打阿拉伯语和本土文化对齐,官方当时强调的就是“从头构建”。

可到了2026年9月发布旗舰M3的时候,沙特还是把底座押在了中国模型身上,只用自己的语料做后训练。

正如前文所述,各国使用中国开源模型这事早就不新鲜了。

3月17日,日本乐天集团高调发布Rakuten AI 3.0,官方口径是“日本国内最大规模的高性能AI模型”,背后站着经济产业省与NEDO联合推进的日本国民级AI项目GENIAC,乐天集团创始人、董事长兼CEO,号称“日本马云”的三木谷浩史亲自站台。

结果发布不到几个小时,就有开发者就在Rakuten AI 3.0的配置文件里看到model_type一栏写着 deepseek_v3。

更尴尬的是,乐天最初上传时直接删掉了DeepSeek的MIT许可证文件,换成自己的Apache 2.0授权。相当于把别人免费赠予所有人的东西,贴上自己标签并且明码标价挂牌出售。

被社区扒出来之后,才匆匆补上一个NOTICE文件承认版权归属于DeepSeek。

相较之下,东南亚就比较敞亮。

新加坡国家人工智能计划AISG在SEA-LION项目,此前使用的是Meta的Llama作为基础模型训练,随后改用阿里云Qwen3-32B作为底座,推出Qwen-SEA-LION-v4。

按照阿里云的说法,AISG往这套底座里注入了超过1000亿个东南亚语言token做后训练,模型在SEA-HELM东南亚语言榜单上位列开源第一。

2025年5月,马来西亚通信部启动号称东南亚首个“主权AI 基础设施”的项目,基础模型用的是DeepSeek。这也是DeepSeek首次以国家级规模在海外部署。

印度是最有意思的对照组,因为它的两个案例性质完全不同。

169PI推出的32B轻量模型Alpie,印度媒体称其为“印度版DeepSeek”,结果通过开发文档发现,怪不得叫印度DeepSeek呢,这根本就是DeepSeek R1。

该模型全称为DeepSeek-R1-Distill-Qwen-32B,这个名称的含义是以DeepSeek R1为教师模型,输出高质量推理,再将其蒸馏到以Qwen为模型基座的32B学生模型上。

还有一家公司叫做Sarvam AI,拿了IndiaAI Mission一大笔算力补贴,约9.9亿卢比、折合约1100万美元,官方口径是“从零训练”,可社区拆开配置一看,多头潜在注意力、GRPO强化学习,闹了半天,还是DeepSeek。

随后,Sarvam AI的CEO也承认,团队“仰慕并学习DeepSeek”。

接下来是韩国,据外媒报道,在其国家级大模型竞赛——主权AI基础模型项目(Sovereign AI Foundation Model Project)中,5支决赛队伍里,至少3支使用了中国的开源模型。

比如Naver队的视觉、音频编码器与阿里的Qwen的特征相似,SK电讯队的推理代码与DeepSeek雷同,Upstage队部分组件干脆直接从智谱GLM那里复制粘贴,经调查发现,Upstage队的项目甚至连智谱的版权标记都没删干净。

欧洲也有类似的事情。前不久才被马斯克收购的Cursor,他们在3月发布了编程模型Composer 2,可开发者从API响应里扒出,模型的实际ID为“kimi-k2p5-rl-0317-s515-fast”。

这才让Cursor承认Composer 2是基于月之暗面Kimi K2.5构建的。只不过走的是Fireworks AI授权合作。

月之暗面很大气,官方随后发帖祝贺,称“Kimi K2.5为Composer 2提供底座支撑”。

OpenAI前CTO米拉·穆拉迪(Mira Murati)创立的Thinking Machines也算半个。

他们7月发布的975B开源模型Inkling,官方技术文档明说MoE架构是来自于DeepSeek-V3,

除此之外,西门子、雷诺、Orange都在VivaTech上公开宣布采用“中美欧混合模型”策略。

中国的模型已悄然成为全球AI的底座。

02

最浅显易懂的道理是便宜。

如果从零训练自己的大模型,光是数据中心就动辄几千万美元。

但是像DeepSeek、Qwen这样的模型,它是开放权重,用的是MIT许可,允许商用、允许改权重、允许本地部署。Meta的Llama虽然也是开源,但不允许大规模使用的,所以对于国家机构、大型公司来说,不可能使用Llama。

而且像是ms‑swift这样的二次开发开源工具齐全,原生深度适配Qwen、DeepSeek、GLM,这就让模型所对应的LoRA、QLoRA、DPO、GRPO、量化、分布式训练全部封装好,一条命令完成微调和对齐。

简单点说就像是预制菜配调料包,拿微波炉热一下就出锅了。

DeepSeek所采用的MoE架构,让每个token只激活37B参数,使得实际的推理成本很低,在部署以后,整个模型的运行成本也就跟着下降。

中国开源模型“规矩”少。

各国发展AI的心态都十分拧巴,既想发展AI,又怕数据出境,还怕闭源API被掐断。

2026年6月,白宫对Anthropic下达出口管制指令,要求暂停外国用户访问其最先进的Fable 5和Mythos 5,Anthropic在收到命令后,宣布禁用这两款模型。

禁令发布过了两周,根据4SAPI的数据,68.4%的中大型企业客户报告核心AI工作流效率下降,31.6%的小微开发者把部分工作负载迁到了其他模型,迁移期间平均推理费用上涨了27.3%。

还没完,Anthropic发布禁用令以后,只给了所有用户90分钟进行迁移。可想而知,那些身处美国之外的用户是多么欲哭无泪。

欧洲企业对此尤其敏感,Llama 4的许可证甚至明确不给欧盟开发者多模态权利,而中国的MIT、Apache 2.0没有相关的条条框框。

于是“本地可部署、权重可拿走”成了硬需求,开源阵营里能同时满足这些要求的,恰恰是DeepSeek、Qwen这一批中国模型。

还不止如此,中国模型恰好长在了别国的需求点上。

使用开源模型的国家往往都有小语种需求,Qwen系列预训练覆盖119种语言和方言,天生适配东南亚、中东这些非英语市场。

同时,DeepSeek、MiniMax M3的推理和工具调用能力比较强,符合各国“本国模型+本土Agent应用”的二次开发需求。

反过来讲,这也是一场中国式的润物无声。

闭源厂商的模型是一种商业性质的模型,强调付费。但中国厂商的态度更像是GitHub,更愿意合作。

比如,月之暗面可以把Kimi通过第三方授权给Cursor用,这种“不抢戏”的姿态,在主权叙事当道的今天,比任何市场策略都好用。

所以,与其说是中国模型成了全世界的基座了,倒不如说是“被选中”了。

03

同样是被别人当底座,在美国,这是一门明码标价的生意。

2026年1月12日,苹果和谷歌官宣多年期合作,Gemini将驱动下一代Siri和苹果的基础模型。

价格没有公开,外媒估算合同价格大约每年10亿美元。

实际上苹果和谷歌是存在强竞争关系的,可为了给自家语音助手装上“大脑”,还是选择每年向竞争对手付10亿美元。

三星和谷歌之间也有合作,虽然没有直接的现金交易,不过也有绑定。

三星的Galaxy AI的核心模型同样也选择了Gemini,2025年覆盖约4亿台设备,2026年的目标是翻倍到8亿台,三星则是给谷歌销售分成,并将谷歌全家桶预设为手机的默认入口。

亚马逊和Anthropic之间的合作走的是另一种模式。

亚马逊此前已经累计投了Anthropic 80亿美元,2026年4月又宣布先投50亿,视其成果最多再投200亿,潜在总额最高能到330亿。

作为交换,Anthropic承诺未来10年在AWS上花掉超过1000亿美元,主力模型训练跑在亚马逊自研的Trainium芯片上。

微软和OpenAI之间也是如此深度绑定,微软累计投入超过130亿美元,按协议先拿走75%的利润分成直到收回投资,之后降到49%。2026年4月27日,双方进一步宣布终止排他性合作,并给利润分成设了支付上限。

Bing、Edge、M365 Copilot、GitHub Copilot,这些产品全线建立在GPT之上。

中国开源厂商,对底座生意似乎不是很感冒,他们更注重生态和标准的复利效应。

中国厂商把权重免费交了出去:不收授权费,不做利润分成,甚至配合对方把模型包装成本国骄傲。那么问题来了,不收钱,图什么?

模型被越多国家采用,多语言能力就会因此提升。且不同国情会让模型的使用方向不同,Agent稳定性也就越高。

当越来越多的国家把国家模型建在中国底座上,中国模型也就成了标准。比如在多模态方面,Qwen-VL早就成为了标准。

按Presenc AI对Hugging Face全站下载量的统计,Qwen3-VL-2B-Instruct是全站下载量第二高的模型,仅次于80MB的embedding模型all-MiniLM-L6-v2,也是Hugging Face唯二破亿下载的模型

标准的价值,远在授权费之上。

本文系作者 字母榜 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里

敬原创,有钛度,得赞赏

赞赏支持
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

登录后输入评论内容

扫描下载App