文 | 反熵
今年WAIC最热闹的展区是机器人,最安静却同样受到关注的展品,当属一排排算力机柜。
华为、阿里、百度、中兴、沐曦等厂商集中展示超节点和算力集群,算力与具身智能也成为大会两条最清晰的产业主线。一边是会走路、能搬运的机器人,另一边是几乎不会动的服务器,看起来相距甚远,但却有着同一套产业逻辑。
![]()
模型负责产生智能,机器人和智能体负责把智能带进现实,数据中心里的芯片、服务器和网络则支撑它们持续运行。AI应用越接近落地,算力问题反而更重要。
人工智能浪潮中,英伟达是最受益的企业之一。
从GPU芯片和CUDA,到服务器、网络互联与数据中心解决方案,英伟达已经建立起一套覆盖硬件、软件和基础设施的完整计算体系。黄仁勋在2025年GTC大会上曾表示,英伟达正在从芯片公司转向AI基础设施公司。这也道出了它真正的优势。
GPU性能是进入AI时代的门票,CUDA生态则构成了更长期的壁垒。
2006年推出CUDA之后,大量开发者、算法工具和企业应用逐渐围绕这套体系建立,PyTorch、TensorFlow等主流AI框架也长期深度支持CUDA。企业如果更换计算平台,需要重新进行软件适配、流程调整、人才培养和已有应用迁移,付出的远不只是采购一批新芯片的成本。
这也是英伟达能够保持较高盈利能力的重要原因之一。客户购买的不只是一块GPU,而是一套已经被产业验证过的AI计算基础设施。
01 英伟达为何领先
英伟达最初并不是一家人工智能企业。
1993年成立时,它主要做游戏显卡。GPU最初的用途,是提升图形处理能力,让游戏画面更流畅。
深度学习兴起后,研究人员发现,GPU非常适合处理神经网络训练中的并行计算任务。传统CPU拥有少量高性能核心,更擅长复杂逻辑处理。GPU拥有大量并行计算单元,可以同时完成海量矩阵运算,而人工智能模型训练,恰恰需要不断进行这类计算。
2012年,AlexNet在ImageNet图像识别竞赛中取得突破,深度学习由此进入快速发展阶段。GPU也逐渐从图形处理设备变成AI计算的重要工具。
大模型时代进一步放大了这一需求。模型规模越大,需要协同工作的GPU越多,训练周期和计算成本也越高。但英伟达真正难以复制的优势,并不只在硬件性能。经过近二十年积累,CUDA已经连接起芯片、软件工具和开发者生态。
芯片性能可以通过一代代产品追赶,开发习惯和软件生态却很难在短时间内复制。这也是国产AI芯片必须面对的核心挑战。
02 AI为何越来越吃算力
一个模型从研发到应用,需要经历预训练、微调、对齐和推理等多个阶段。
预训练阶段通常消耗最大。模型需要从海量数据中学习语言规律、知识结构和复杂关系,大规模模型训练往往需要数千张计算卡持续运行数周甚至更长时间。
微调和对齐,则是让模型适应具体任务。一家银行训练客服模型,需要让它理解业务规则和金融产品;一家医院开发辅助诊断模型,需要让它掌握专业知识和医疗规范。
但真正让算力需求持续增长的,是推理。
模型训练完成后,每一次客服问答、代码生成、办公协作和内容创作,依然需要计算资源。智能体进一步放大了推力需求:普通聊天通常是一问一答,智能体为了完成一项工作,还要拆解任务、查找资料、调用工具并反复检查结果。一次看似简单的用户指令,背后可能对应多轮模型调用。
今年WAIC上,智能体从聊天框走向工作台,成为贯穿模型、终端和行业应用的重要主线。AI从“回答一个问题”走向“完成一项工作”之后,计算消耗不再只取决于用户问了多少次,还取决于任务链条有多长。
![]()
根据国家数据局披露的数据,中国公有云大模型Token调用量已从2024年初的日均约1000亿,增长至2025年底的日均百万亿级规模。DeepSeek等模型降低调用成本后,更多应用开始具备落地条件。应用规模越大,调用频率越高,对算力的需求也越强。
训练能力决定模型能够达到怎样的水平,推理能力则决定这些能力能服务多少用户。
03 中国如何补上算力短板?
大模型竞争看起来发生在云端,真正的起点却在机房。
对于中国而言,建设自主AI算力体系,既关系到产业发展,也决定着未来人工智能应用能扩展到多大规模。
目前,中国企业正在围绕不同技术路线探索AI计算能力。
华为昇腾是其中最具代表性的方向之一。它没有把竞争局限在单颗芯片,而是围绕昇腾处理器、Atlas服务器、CANN软件平台、高速互联和开发生态,建立一套完整的计算体系。
2025年,华为推出昇腾384超节点方案,通过384张计算卡协同提升系统算力。今年WAIC上,Atlas 950 SuperPoD完成真机首展,最大可扩展至1024张计算卡,并通过高速互联和统一内存编址,降低设备之间的数据传输损耗。
![]()
这并不意味着国产单卡已经全面追平英伟达,但可以说明竞争有了另一种解法。在单颗芯片和先进制程仍有差距的情况下,通过更大规模的系统协同提高整体计算能力。
国内其他厂商也在沿着不同路径推进。寒武纪、海光信息从芯片切入,在训练和推理场景中寻找突破。百度昆仑芯、阿里平头哥与自身云计算业务结合,以内部应用带动芯片迭代。摩尔线程、沐曦则瞄准通用GPU,希望在图形计算、通用计算和AI加速之间建立更广泛的能力。
今年WAIC上,多家厂商集中展示了超节点或集群方案。它们的互联架构、芯片配置和软件体系并不相同,但行业共识已经达成。国产算力的竞争单位,已经从一颗芯片扩大到由芯片、互联、整机和软件构成的完整系统。
国产算力需要补上的,也从来不只是一颗芯片。
04 算力竞争走向系统
大模型通常需要被拆分到多张计算卡上运行,芯片数量越多,数据交换越频繁。如果互联速度不足,大量时间便会消耗在设备之间搬运数据,形成“通信墙”。如果不同设备的显存无法被统一、高效调度,模型规模和算力利用率又会受到“显存墙”限制。
机器增加一倍,算力未必增长一倍。有时规模越大,协调损耗反而越严重。
超节点要解决的,就是如何让几十张、几百张甚至上千张计算卡更像一台机器。英伟达通过NVLink和InfiniBand网络提高GPU集群的协同能力。华为、阿里、百度、中兴等国内厂商也在高速互联、统一内存编址、液冷和软件调度方面推出系统级方案。
竞争的重点因此从谁的单卡更快,逐渐转向了谁能让更多芯片高效协同。
根据WAIC相关报道,昇腾上一代384卡超节点已累计发货750套,覆盖互联网、运营商、金融、教育、医疗、交通和制造等多个行业。超节点开始离开展台,进入真实业务。
客户关心的也不再只是理论峰值,而是系统能否稳定运行、软件是否容易迁移,以及每投入一度电,最终能够产出多少有效Token。
能源供应和数据中心建设也随之进入竞争范围。一个万卡级训练集群,功率可能达到数十兆瓦。数据中心的选址、电力成本、液冷散热和算电协同能力,都会影响最终的算力价格。
今年WAIC上,超聚变等厂商集中展示高密度液冷和多元算力集群方案,国家电网、南方电网等企业也在推进算电协同。算力竞争已经不只是半导体产业的问题,它开始将通信、电力、能源和工程建设卷入同一套体系。
![]()
对于后发者而言,这种变化提供了新的空间。即使单颗芯片暂时存在差距,也可以通过互联、调度、整机和应用适配,提高整个系统的有效计算能力。
但系统竞争并不等于依靠数量堆叠。芯片、互联、软件和能耗中的任何一项出现短板,都可能拖累整体效率。国产算力真正要完成的跨越,是从“能够运行”走向“稳定、好用和经济”。
05 算力最终要变成智能
互联网时代,服务器、通信网络和数据中心支撑了数字经济的发展。AI时代,算力正在成为新的基础设施。
大模型训练需要算力,智能体运行需要算力,机器人理解环境、规划动作,同样需要算力。超节点、智能体和机器人之所以在今年WAIC同时成为焦点,也正因为他们处在同一个循环中。更大的模型推动算力系统升级,更低的计算成本让智能体和机器人打开商业空间,更多应用又会产生新的计算需求。
但算力本身不是终点。一座数据中心建设得再大,如果无法转化为更好的模型、更便宜的Token和真正有人使用的产品,也只是一台昂贵的机器。
所以,AI竞争为什么先比算力?
因为算力决定了参赛资格。模型决定AI能够完成什么,算力则决定这些能力能否以足够低的成本服务更多人。
拿到参赛资格之后,真正决定胜负的,仍然是模型能够创造多少实际价值。
下一篇,我们讨论DeepSeek之后,大模型竞争正在进入怎样的新阶段。







快报
根据《网络安全法》实名制要求,请绑定手机号后发表评论