文 | 象先志
沙特把本国阿拉伯语大模型的开发任务,交给了 MiniMax 。
9月3日,沙特公共投资基金 PIF 旗下的 HUMAIN 发布阿拉伯语模型 HUMAIN-M3。它有4280亿总参数,每个 token 激活230亿参数,使用超过1万亿阿拉伯语 tokens 继续训练。模型部署在 HUMAIN Node 上,未来还计划开放权重。HUMAIN 的董事长,是沙特王储小萨勒曼。
你品,你细品。
HUMAIN倒不像某些国家的公司,魔改deepssek然后说是自研,官方新闻稿写得很清楚:模型经委托,由中国公司 MiniMax 开发,底座是 MiniMax-M3。沙特拿出资本、算力和阿拉伯语数据,MiniMax 提供已经完成基础训练的模型。双方合作的结果,再以沙特国家模型的名义发布。
发布前两天,沙特科技博主 Sultan Alfaifi 抢先在 X 上称它是“100% 沙特”模型。帖子拿到28.5万次浏览后,有人在评论区追问:“100% 沙特?敬畏真主吧,苏丹。”后来,博主更正:“感谢纠正,它基于 MiniMax 的 M3。”AI 骄傲确实也存在,博主应该是一时间上了头。
![]()
图1 沙特科技博主称 HUMAIN-M3 是“100% 沙特”模型
中文翻译:HUMAIN-M3 来了。这是 HUMAIN 旗下“100% 沙特”的模型,号称在七项阿拉伯语测试中表现强劲,符合沙特文化和语言。模型为智能体设计,可直接集成;未来将开放权重,并可在沙特本地服务器运行。来源:X 原帖
![]()
图2 评论区质疑“100% 沙特”后,发布者更正底座来自 MiniMax
中文翻译:质疑:“100% 沙特?敬畏真主吧,苏丹。”更正:“感谢纠正。它基于 MiniMax 的 M3。”来源:X 原帖
沙特用资金、算力和本地数据,换到了几年训练时间和模型控制权;MiniMax 也不再只向海外出售调用次数,而是进入了他国模型研发的最底层。
这次,中国大模型出海往前推了一层。过去输出 App 和 API,海外客户是用户;现在输出基础模型,海外客户可以继续训练、重新命名,再把它变成自己的“国产 AI”。
更进一步来看,中国的开源大模型们正在容纳各种语言,几乎快要成为世界 AI 的统一语言了。
沙特用钱买时间,也买控制权
2025年5月,小萨勒曼亲自宣布成立 HUMAIN。这家公司由沙特公共投资基金 PIF 持有,业务覆盖数据中心、云、模型和应用。沙特要的不只是一个能说阿拉伯语的聊天机器人,而是从算力到应用都尽量掌握在自己手里的 AI 体系。
沙特有钱、有能源,也可以买 GPU,但从零训练前沿模型仍然要付出几年时间和大量失败成本。MiniMax 提供一个已经完成基础训练的模型;沙特提供算力、本地数据和应用场景,再用超过1万亿阿拉伯语 tokens 继续训练。这笔合作省下的首先不是 API 费用,而是从零开始的时间。
按照 HUMAIN 公布的数据,HUMAIN-M3 在七项阿拉伯语公开基准上的等权平均分达到89.37%,比未经本地化训练的 M3 参考模型高出9个百分点,并在五项测试中取得最高分。不过,这七项都是阿拉伯语基准。但这也足以证明:一个国家建设本土模型,不一定要从预训练的第一步开始。
![]()
图3 MiniMax 官方确认 MiniMax-M3 为 HUMAIN-M3 提供底座
中文翻译:MiniMax 官方表示,MiniMax-M3 为 HUMAIN-M3 提供底座。HUMAIN-M3 基于 M3,并使用超过1万亿阿拉伯语 tokens 继续训练,覆盖多种阿拉伯语及地区方言。来源:X 原帖
沙特也由此建立了 AI 主权,相比于只能使用ChatGPT、Claude 等闭源模型,数据、训练、服务、信息安全都可以掌握在自己手里。
![]()
图4 阿拉伯语开发者提醒不要把语言榜单扩大成通用能力结论
中文翻译:这个模型其实来自 MiniMax,只是在阿拉伯语数据上继续训练。基准只测试阿拉伯语能力。它的阿拉伯语表现确实达到前沿水平,但编程和电脑操作能力仍然较弱。来源:X 原帖
中国模型开始成为各国“自研”的上游
HUMAIN-M3 不是孤例。越来越多海外机构说的“自研”,已经不是从第一块 GPU、第一批预训练数据开始。它们掌握本地数据、完成后训练、负责部署和应用,基础模型则从全球开放模型中选择。此前,Llama 是最常见的选择之一;现在,中国模型正在大量进入。
日本乐天发布 Rakuten AI 3.0 时,强调它是一款高性能日语模型。但公开配置文件里,模型类写着“DeepseekV3ForCausalLM”,模型类型则是“deepseek_v3”。仅凭配置不能断言乐天复制了 DeepSeek 权重,却足以说明 DeepSeek 定义的架构和兼容方式,已经进入日本本土模型的技术路线。
由新加坡国家研究基金支持的 AI Singapore,则把 Qwen3-VL 继续训练成 Qwen-SEA-LION,一口气适配缅甸语、印尼语、菲律宾语、马来语、泰米尔语、泰语和越南语;泰国 CMKL 大学又拿 Qwen3.5 做出泰英双语模型 MANGO。把沙特的阿拉伯语和乐天的日语算上,围绕中国模型及其架构的本地化案例,已经覆盖至少九种非中文语言。九种语言,九套本地数据,名字一个比一个本地,模型卡往前翻一层,却不断出现 Qwen、DeepSeek 和 MiniMax。
Meta 的“牛油果计划”把这套比较带进了美国大厂。据彭博等媒体报道,Meta 在训练代号 Avocado 的新模型时,使用了 Qwen、Gemma 和 OpenAI 的 gpt-oss 等开放模型。连拥有全球顶级研究团队的 Meta,也不再执着于所有训练材料都必须由自己生产。对 Meta 来说,Qwen 不需要变成最终产品,只要能更便宜、更快地补齐能力,就有机会进入训练流程。
Kimi 的故事更是有些玄幻,现有 Cursor 套壳,后有坊间传闻说 Claude 旗下团队因为自家模型成本太高而选择了本地部署 Kimi K3。虽然缺乏可核验的一手身份和部署记录,但能确认的是,Kimi 已经提供接入 Claude Code 的兼容方案;美联社也报道,Mozilla 技术负责人 Raffi Krikorian 把不少日常任务转向 Kimi K3,理由就是更快、更便宜。
MiniMax、Qwen、DeepSeek 和 Kimi虽然隶属不同公司,但是他们的开源路线却得到了一致肯定:成本考量、权重保留,更重要的是,从根本上杜绝了被“制裁”的可能。从头预训练太贵,长期调用闭源模型又把数据和服务交给供应商。中国开放模型填上了两者之间的空白。
Hugging Face 的数据给了这股趋势一个底数。过去一年,中国研发的模型占平台下载量的41%,首次超过美国;仅 Qwen 家族就已经衍生出超过11.3万个模型。下载量仍然不等于商业收入,衍生模型也不等于永久依赖。但当下载、微调、部署和再训练同时发生,中国开放模型就不再只是几款热门产品,而开始成为各国建设本土模型时绕不开的上游。
中国开放模型提高了全球AI及格线
过去几年,GPT 和 Claude 定义了模型能力的上限。新模型发布,首先要证明推理、编程和 Agent 能力离它们还有多远。中国开放模型没有取代这套标准,却改变了及格线:相近能力为什么还要卖得那么贵,为什么不能本地部署,为什么不能让客户继续训练。
一款海外模型今天想证明自己值得采购,只说“比上一代更聪明”已经不够。它还得回答:跟 Qwen、DeepSeek、MiniMax 相比,单位能力贵多少;客户能不能拿到权重;政府和企业能不能把数据留在自己的服务器。当沙特国家级平台、日本企业、新加坡国家项目和 Meta 用自己的行动印证了,中国开放模型就成了一套共同的度量衡。
中国参与建设的世界人工智能合作组织 WAICO,也在推动全球南方的 AI 能力建设;中国还提出面向阿盟建设国际 AI 应用合作中心。HUMAIN-M3 与这条政策方向一致,但目前没有公开材料证明项目由 WAICO 直接撮合。它更像商业需求先跑到了政策所指的方向。
![]()
图5 Inferact 确认 HUMAIN-M3 的推理由开源框架 vLLM 支撑
中文翻译:Inferact 表示,HUMAIN-M3 已经在 HUMAIN Node 上线,其底层推理由 vLLM 支撑,采用的是“开放权重模型加开放工具链”的技术栈。来源:X 原帖
中国模型成为度量衡,开放权重方便客户采用,也方便客户换掉底座;模型被重新训练和命名后,中国品牌甚至可能完全消失。MiniMax 使用的是社区许可,严格说更接近“开放权重”,而不是没有限制的开源软件,但这无疑是 token 经济的一种全新范式。








快报
根据《网络安全法》实名制要求,请绑定手机号后发表评论