文 | 影子备忘录
国庆假期前一天,DeepSeek放出了一条一则消息:正式开源面向华为昇腾算力平台的基础设施组件,涵盖TileLang高级语言编译工具、高性能计算库与分布式通信库,所有组件与此前面向英伟达平台的开源组件一一对应。
如果你只把这当作一次普通的“国产适配”,那可能会错过这件事真正的分量。
过去几年,国产芯片适配大模型的新闻并不少见,但大多是“能在上面跑起来”的层面,比如验证兼容性,刷个适配公告,然后就没有然后了。
不过这次不一样,因为DeepSeek把自己在英伟达平台上打磨成熟的那套工具链,几乎完整地、成体系地搬到了昇腾上,而且关键测试中的计算与通信性能已经接近硬件上限。
这不是一次适配,这是一次搬家。
算力焦虑的尽头,是别无选择
要理解DeepSeek为什么在此时选择华为,得先理解这家公司正面临什么。
梁文锋在今年7月的一场闭门投资者会议上,说了一句非常坦率的话:中美AI能力之间的差距,包括人才、模型性能和应用等都可以归结为一个变量,算力资源。
他透露DeepSeek目前运营着约2万块英伟达H系列同等算力的芯片,但无法采购到足够的硬件来训练最大规模的前沿模型。
他估算,训练顶级大模型可能需要约5万颗英伟达GB300芯片,若采用华为昇腾950,则可能需要约20万颗。
“今年能花出去200亿人民币,就说明我们的采购团队表现出色了。要花到这个数实在太难了。芯片买不到,价格还高。”
这段话里有两层意思。第一层是外部供应的不确定性,主要是出口管制持续收紧,英伟达对华特供芯片的供应既不充足也不稳定。
第二层是即便买到了,成本也高得令人窒息。DeepSeek V4-Pro的API输入价格低至0.25元/百万词元,而GPT-5.5 Pro加权平均输入价格为30美元/百万词元,两者相差超过700倍。
这种极致性价比的定价策略,要求基础设施成本必须被压到极限。而英伟达芯片的采购价格摆在那里,再怎么优化,成本曲线也降不下来。
相比之下,华为昇腾新款推理芯片的采购价格仅为英伟达的四分之一,单卡算力却比英伟达对华特供版提升了2.87倍。
梁文锋对华为昇腾950超节点的评价是:“在性能和价格上完全可以平替英伟达的GB200和GB300。”
这就不难理解为什么DeepSeek把使用华为等国产芯片训练大模型列为重要战略方向。
据彭博社报道,DeepSeek已向华为订购了16万颗昇腾950DT芯片,用于其位于内蒙古的1GW数据中心。梁文锋甚至说,这项工作“必须成功”。
TileLang这步棋,走在了所有人前面
但仅仅因为“买不到英伟达芯片”就去拥抱华为,这个叙事太单薄了。真正值得拆解的,是DeepSeek选择合作的技术路径。
答案藏在TileLang里。
这家公司从训练V3模型开始,就在做一件很多同行没有做的事情,他们正在用自研的TileLang高级语言来写算子,而不是直接调用CUDA。
TileLang的设计思路是:让开发者用更简洁的高级语言编程,同时通过编译器优化达到接近硬件性能上限的执行效率。
目前,DeepSeek V4系列模型训练中大部分算子已经基于TileLang实现。
这也意味着DeepSeek在英伟达平台上构建模型时,并没有把自己和CUDA生态绑死。TileLang扮演了一层抽象,往上承接模型训练的逻辑,往下对接芯片的底层指令。
当这层抽象被移植到昇腾平台时,对昇腾Ascend C底层指令进行封装,开发者的代码逻辑几乎不需要重写。
从目前的情况来看,梁文锋确实把这条路走通了。华为950超节点“四颗芯片的算力相当于一颗英伟达芯片”,双方在芯片本身仍存在“四倍加两年”的差距,但生态适配的障碍已经被跨过去了。
对比一下OpenAI和Anthropic的做法,这条路径的独特性就更清楚了。
OpenAI选择的是自研芯片,他们与博通合作开发了Jalapeño推理加速器,同时与Cerebras签署了超过200亿美元的算力服务协议,走的是“定制硬件+多元供应商”的路子。
Anthropic则在模型性能上持续加码,Sonnet 5.5在编码基准上已经超越了自家旗舰Opus 5.5,同时成本只有GPT-6 Sol的五分之一。
两家美国头部公司,一家向左往硬件深处走,一家向右往模型效率走,但都没有走“把一个成熟的软件工具链跨平台移植”这条路。
DeepSeek走的是第三条路。它的赌注在于:软件工具链的可移植性,可能比芯片本身的性能差距更重要。
当TileLang在昇腾上跑通,所有使用TileLang的开发者,理论上都可以在昇腾上构建模型,而不需要重新学习一套编程范式。
华为也将本次联合创新的成果在CANN社区开源,覆盖大EP低延时推理部署、单卡/单机部署、大规模训练、超长文本KVcache池化与Agentic RL,开发者拿到的是可以直接用的实践方案。
不只是DeepSeek一家的选择
如果把视角拉远一些,会发现DeepSeek的决策并非孤立事件。
智谱AI在今年1月联合华为开源了GLM-Image,这是首个完全基于国产芯片(昇腾Atlas 800T A2)和昇思MindSpore框架完成全流程训练的SOTA多模态模型。
到了2月,智谱完全使用华为昇腾910C芯片训练的7440亿参数GLM-5模型,在“人类最后的考试”基准测试中登上了榜首,全程没有使用任何英伟达GPU。
阿里通义千问、字节豆包、百川智能等头部玩家,都在同步推进国产算力适配。
彭博行业研究的一项调查显示,中国企业计划在未来12个月内将46%的AI加速芯片预算用于采购国内芯片,远高于目前的30%。
深圳已经投运了基于昇腾910C的1万卡AI算力集群,预约率达到92%。
这不是一两家公司的孤勇,而是一个行业在供应链约束下的集体战略调整。
区别在于,DeepSeek这次做的是“从根上”解决问题,而不是简单地让模型能在国产芯片上跑,这是在国产芯片上构建一套完整的、从编译工具到通信库的基础设施。
华为向DeepSeek提供的昇腾超节点SuperPoD Flex和UBL128组网方案,可实现128卡3.2Tbps单层交换的Scale-up网络和256K卡两层交换的Scale-out网络,兼顾超低时延推理与前沿基座模型的大规模训练需求。
DeepSeek团队开发的DeepEP通信库,实测互联带宽达到Dispatch 375 GB/s、Combine 347 GB/s,已经接近硬件上限。
这些数字说明,至少在超节点这种大规模并行计算的场景下,昇腾平台的通信效率已经达到了可用的水平。
软件生态才是真正的护城河
回过头来看,DeepSeek选择在这个时间点与华为深度合作,还有一个容易被忽略的考量。
英伟达的CUDA生态之所以牢固,核心不在于芯片本身,而在于十余年积累的数百万开发者、成熟的工具链和丰富的代码库。
换成硬件容易,换成生态极难。梁文锋对此的判断是:CUDA的护城河正在“迅速瓦解”,中国AI芯片产业正面临取代外国硬件的“历史性机遇”。
他预测,在一年之内,实际部署情况将颠覆市场上认为国产芯片生态“不可用或难以使用”的看法。
这话听起来像是乐观主义者的宣言。但从技术角度看,他手里确实有几张牌。
TileLang本身就是一张牌。它的定位是比CUDA更简单的高级语言,能显著提高开发效率、简化代码逻辑,同时不损失硬件性能。
如果TileLang的昇腾版本能够吸引足够多的开发者使用,那它就构成了一条绕过CUDA的通道,最终的结果是开发者不需要学CUDA,只需要学TileLang,就能在两种芯片平台上部署模型。
DeepSeek把TileLang昇腾版本开源,并明确表示希望“对更多AI芯片建立高可用软件生态起到示范作用”,这背后的意图再清晰不过了。
另一张牌是DeepSeek自身开源模型的号召力。DeepSeek V4系列是目前全球开源大模型中最受关注的之一,开发者基数庞大。
当这些开发者习惯了用DeepSeek的模型和工具链,迁移成本就自然降低了。
而如果昇腾平台能够提供与英伟达平台“一一对应”的组件,迁移就变成了换一个`pip install`的事。
当然,乐观归乐观,现实中的挑战也不容回避。
梁文锋坦承,华为的产能是当前最主要的瓶颈。华为昇腾950DT的年产量仅有几十万颗,DeepSeek那笔16万颗的订单可能需要长达一年才能交付。
华为自身也承认,由于产能受限、国内需求旺盛,下一代昇腾900系列将主要面向中国市场供应,暂不会全面推向海外。
产能问题不解决,生态的雪球就滚不起来。
写在最后
站在2026年秋天回看,DeepSeek与华为昇腾的合作,与其说是一个“去英伟达化”的故事,不如说是一个关于“选择权”的故事。
过去几年,中国AI公司在大模型训练上几乎只有一条路:买英伟达芯片,用CUDA生态,在既定的游戏规则里竞争。
出口管制收紧之后,这条路越来越窄,成本越来越高。
DeepSeek的选择是与其在一条越来越窄的路上挣扎,不如和芯片厂商一起,把第二条路修出来。
至于这条路修得怎么样,现在还不好下定论。
TileLang能否成为真正的“中国版CUDA”的雏形,昇腾的产能能否跟上需求,超节点方案在实际训练中的稳定性如何,这些都需要时间检验。
但至少有一点是确定的:当一个行业最顶尖的模型公司愿意把自己最核心的工具链,成体系地移植到一个新的硬件平台上,并且公开宣称“性能接近硬件上限”的时候,这条路就不再只是一个备选方案了。







快报
根据《网络安全法》实名制要求,请绑定手机号后发表评论