马斯克刚刚在 Kimi K3 的评测报道下敲下“Impressive”三个字,转身就亮出了自己的底牌。
7 月 16 日,月之暗面(Moonshot AI)正式发布第三代旗舰开源模型 Kimi K3。2.8 万亿参数,100 万 token 上下文窗口,Frontend Code Arena 前端编程榜单以 1679 分登顶全球第一。马斯克在相关报道评论区留言“令人印象深刻”。不到 24 小时后,7 月 18 日,他就在社交平台 X 上透露:xAI 旗下 2 万亿参数的大模型 Grok 4.6 将于下周完成初始训练,性能超越此前 1.5 万亿参数的 Grok 4.5,且可能直接挑战 Kimi K3。
一个在点赞,一个在追赶。超大规模参数竞赛的画风,正在变得前所未有的微妙。
两天内的两场“军备展示”
把时间线拉回到 7 月 16 日。上海世界人工智能大会开幕前夕,月之暗面选择在这个时间窗口发布 Kimi K3。这是一次精心策划的技术亮相。
2.8 万亿参数,这是目前全球开源模型中规模最大的一个。Kimi K3 采用混合专家(MoE)架构,总参数 2.8 万亿,在 896 个专家中通过 Stable LatentMoE 框架每次推理仅激活 16 个专家,激活参数占比极低。配合自研的 Kimi Delta Attention(KDA)混合线性注意力机制,在百万 token 长上下文场景下实现最高 6.3 倍解码加速。Attention Residuals(AttnRes)结构以不到 2% 的额外成本,将训练效率提升约 25%。
结果很炸裂。在 Arena AI 的 Frontend Code Arena 前端代码盲测平台上,Kimi K3 以 1679 分超越 Claude Fable 5 和 GPT-5.6 Sol,登顶全球第一。七个前端细分领域,它拿下了六个第一。在 AA-Briefcase 智能体知识工作测试中,Kimi K3 获得 1527 分,排名仅次于 Claude Fable 5 Max,超越了 GPT-5.6 Sol Max。
但最吸引马斯克注意力的,可能不只是这些数字。
今年 3 月,Kimi 团队发布改进残差连接的 AttnRes 技术论文时,马斯克就曾转发并称赞“Impressive work from Kimi”。7 月 17 日他再次点赞,说明这位 xAI 掌门人一直在关注这家中国 AI 公司的技术进展。而点赞之后不到 24 小时,他就放出了 Grok 4.6 的消息。训练进入收尾阶段,2 万亿参数,下周完成。
这不是巧合。这是“我看到了你的牌,现在轮到我出牌了”。
参数竞赛的数字游戏
2 万亿叫板 2.8 万亿,乍看之下,Grok 4.6 在参数规模上落后了 8000 亿。但事情没那么简单。
Kimi K3 的 2.8 万亿是总参数,但每次推理仅激活 16 个专家,实际激活参数占比极低。这是 MoE 架构的精髓,让模型“有知识但不必全用上”。而 Grok 4.6 的 2 万亿参数,按照 xAI 此前对 Grok 系列的设计传统,同样采用 MoE 架构。Grok 4.5 基于 1.5 万亿参数的 V9-Medium 基座,马斯克曾声称其“在某些性能上接近甚至超越 Claude Opus”。
参数竞赛的残酷之处在于,参数多不等于能力强。Kimi K3 虽然总参数达到 2.8 万亿,月之暗面官方也坦承,其综合智能水平仍落后于 Claude Fable 5 和 GPT-5.6 Sol 这两款顶尖闭源模型。换句话说,参数规模正在从“能力指标”变成“营销指标”。
但没有人敢停下来。2026 年 5 月,马斯克宣布 1.5 万亿参数的 V9-Medium 完成训练。仅仅两个月后,2 万亿参数的 Grok 4.6 就进入收尾阶段。xAI 每一代模型的参数增长曲线几乎是垂直拉升,从 Grok 1 的 314B,到 Grok 4.5 的 1.5T,再到 Grok 4.6 的 2T,而传闻中的 Grok 5 更是直接瞄准了 6 万亿参数。
月之暗面同样如此。从 K2 到 K2.5、K2.6,再到 K3,这家公司在过去 12 个月中有 9 个月保持着开源模型参数规模的上限。
双方都在用参数规模证明“我还活着,而且跑得比你快”。
开源与闭源的两条路线对决
Kimi K3 的发布之所以引发全球关注,核心原因只有一个。它是开源的。
Claude Fable 5 和 GPT-5.6 Sol 虽然性能更强,但都是闭源模型。在 3 万亿参数级别,Kimi K3 是首个正式开放权重的开源大模型。完整模型权重将于 7 月 27 日向全球开发者开放,届时任何人都可以下载运行这套 2.8 万亿参数的大模型。
这是一个重要的战略选择。月之暗面选择走开源路线,意味着它放弃了闭源模型的商业护城河,换取的是全球开发者的生态系统和社区贡献。这是 DeepSeek 走过的路,也是 Meta 的 Llama 系列走过的路。这条路的好处是,一旦形成生态,竞争对手很难用同样的投入获得同样的社区影响力。Kimi K3 发布当天,Arena 评测平台上的排名跃升 17 位(从第 18 名到第 1 名),OpenCV 社区和 Hacker News 上相关讨论迅速发酵。开源社区的力量正在被激活。
而 xAI 的 Grok 走的是另一条路。Grok 主要嵌入 X 生态,面向 X Premium 订阅用户,同时也在特斯拉和 SpaceX 内部进行 beta 测试。Grok 4.5 目前正在 SpaceX 和 Tesla 内部进行私有测试,据称性能接近 Claude Opus,在某些场景下甚至超越。Grok 4.6 上线后,大概率走同样的路径,优先服务马斯克商业帝国的内部需求,再向外部开放。
两条路线没有绝对的对错,但结果截然不同。Kimi K3 在发布当天就引爆了全球开发者的讨论,而 Grok 4.6 的消息更多停留在资本市场和行业观察者的关注圈内。
算力底牌:谁的“燃料”更充足
训练一个 2 万亿参数的大模型,需要的不只是算法,还有“暴力美学”级别的算力支撑。
xAI 的底气来自 Colossus 超大规模 AI 算力集群。据公开信息,该集群搭载约 20 万块 GPU,全面支撑模型训练与强化学习全流程。马斯克甚至直接空运燃气轮机给数据中心供电。xAI 已从韩国斗山能源公司增购 5 台 380 兆瓦燃气涡轮机,因为田纳西和孟菲斯的电网根本撑不住,这些轮机预计可额外支撑 60 万台以上 GPU 等效规模的数据中心集群。
这是一个恐怖的算力储备。如果“更多算力等于更强模型”这个假设成立,那么传闻中的 6 万亿参数 Grok 5 一旦发布,将成为真正的怪兽级模型。
相比之下,月之暗面的算力储备没有公开详细数据,但国内 AI 公司在高端 GPU 获取上受到的限制是不争的事实。Kimi K3 能在这种条件下做到 2.8 万亿参数的训练,本身就是一个工程奇迹。用更少的算力,训练更大的模型。月之暗面官方称,Kimi K3 相比前代模型的整体扩展效率提升约 2.5 倍,能更有效地将算力转化为智能。这就是“有限资源”下的生存法则,算力不足,就必须在算法效率上做到极致。
Kimi K3 的 48 小时自主芯片设计实验,某种程度上也印证了这种效率优先的思路。在 45nm 工艺节点上,用开源 EDA 工具独立完成专用芯片的构建、优化与验证,仿真解码吞吐量超过每秒 8700 个 token。这颗由模型设计、为模型服务的芯片,展示了 K3 在长程 Agent 任务中的执行力,也暗示了月之暗面在软硬件协同优化上的野心。
参数竞赛的终点在哪里
一个值得注意的信号是,马斯克在宣布 Grok 4.6 时特意强调,推理速度和 Token 效率将与前代 1.5 万亿参数版本基本持平。
这句话透露了一个关键信息。xAI 自己也清楚,单纯堆参数已经不够了。如果模型变大但推理变慢,成本变高,用户不会买单。Grok 4.6 的核心目标是在扩充模型规模的同时,稳住前代产品的运行效率,兼顾性能与使用成本。
这恰恰是超大规模参数竞赛面临的普遍困境。模型越大,推理成本越高,商业化越难。Kimi K3 发布后,API 输出定价为每百万 token 100 元人民币,输入每百万 token 20 元人民币(缓存命中仅 2 元)。有开发者调侃:“便宜的开源模型不再存在了。”当规模增长带来的收益开始边际递减,而成本却在指数级上升,参数竞赛的终点就越来越近了。
但另一个趋势同样值得关注。Kimi K3 在长程自主编程和知识工作上的表现,以及其 48 小时自主设计芯片的能力,正在让“大模型的能力边界”从问答扩展到执行。而 xAI 拥有特斯拉的自动驾驶数据、X 平台的社交数据和 Optimus 机器人的物理世界数据,这是任何竞争对手都无法复制的数据飞轮。
谁能在“更大”和“更实用”之间找到平衡,谁就能在这场竞赛中笑到最后。
参数可以堆到万亿,但真正的智能,从来不是靠堆出来的。






快报