文 | 影子备忘录
2026年的AI产业,正在经历一场冰火两重天的撕裂。
一边是资本市场寒意阵阵:科创50指数在7月骤然转跌,累计跌幅约20%,融资盘连续多日净卖出。
另一边,刚刚落幕的2026世界人工智能大会(WAIC)上,H2算力主题展区内人潮涌动,观众超40万人次,全球177个重要采购团组预计达成意向采购金额约203.6亿元。
冰与火的交汇处,一个词反复出现在所有展台最醒目的位置——“超节点”(Super Node)。
这场反差并非第一次出现。每一轮重大技术范式的切换,都伴随着资本市场与产业界的认知时差。当市场还在用旧框架定价时,产业已经进入了新范式。而2026年的新范式,就叫超节点。
为什么?因为算力,真的不够用了。
今年,几家头部模型公司都推出了更为先进的模型:2月智谱发布GLM-5大模型,7月月之暗面发布高达2.8万亿参数的Kimi K3大模型。但他们不约而同地被“卡”在了算力上,不得不靠提价、限购等措施来抑制需求。
商汤大装置披露的数据显示,其日均Token服务量已达2.42万亿,预计2026年全年服务规模实现25倍增长。
这不是某一家公司的问题。AI应用正在从聊天交互向智能体任务进化,单智能体的Token消耗可达传统对话应用的百倍至千倍级。正如中国工程院院士郑纬民所指出的:“驱动智能体的Token正在成为新的‘石油’。”
但“石油”也有枯竭的一天。算力供给端呢?英伟达最新的高端卡今年很难大批进入国内市场,存量供给几乎没怎么增长。需求暴涨,供给不动,算力缺口以肉眼可见的速度在扩大。
于是,一场围绕算力的“军备竞赛”全面打响。Meta直接将2026年资本支出指引上调至1250亿至1450亿美元,几乎是2025年的两倍。
微软2026年Capex预计约1900亿美元。摩根士丹利预测,五大云厂商2026年资本开支将达到8050亿美元,2027年进一步升至1.116万亿美元。
国内方面,字节跳动、阿里巴巴、腾讯2026年上半年AI相关资本开支同比增幅均超过50%。
数千亿美元砸下去,买的是什么?不是单张显卡,而是一个个“超节点”。
把一千张卡变成“一台计算机”
“超节点”这个概念并不新鲜,但2026年的WAIC上,产业界第一次给出了严格的定义。
7月19日,鹏城实验室与全球计算联盟联合发布了《超节点定义与实践白皮书》,首次明确:超节点是一种在物理上由多个计算节点通过高效的互联协议紧密连接组成,具备跨物理节点统一内存编址能力,逻辑上具备“一台计算机”特征的计算系统。
翻译成大白话:过去AI集群的基本单元是单台8卡服务器,跨服务器通信是绕不开的瓶颈。
超节点要做的,就是通过高速互联和统一内存语义,把分散在数十台服务器里的成百上千张芯片,压进一个低延迟、高带宽的域内,让它们像一张芯片那样协同工作。
这绝非简单的“堆芯片”,而是一场算力组织方式的质变。
真正的超节点必须具备三个技术特征:超大带宽、超低时延、统一内存编址。其中“统一内存编址”被视作灵魂,它意味着不同节点的内存被纳入同一个地址空间,任意处理器可直接读写远端内存,无须经过额外的编解码流程。
按照这个标准,可以明确区分“真超节点”与“伪超节点”。后者本质上仍是传统服务器堆叠架构,依赖PCIe或RoCE协议互联,跨服务器带宽、时延受限。
WAIC现场技术人员打了个比方:“好比一个城市,如果每个区域之间通行都要经过收费站和翻译,效率必然大打折扣;真正的超节点就像把整个城市的路网统一编码,车可以直接开到任何地方。”
那么,超节点到底有多“超”?
华为在WAIC上首次公开展出了昇腾950超节点真机,它由16台计算柜拼接而成的巨型阵列,1024张算力卡密集嵌入,这是目前业界公开的最大规模超节点。
它基于灵衢互联协议,提供1 EFLOPS FP8、2 EFLOPS FP4算力,拥有256TB全局统一内存编址空间,RTT时延控制在3微秒以内。
作为对比,英伟达当前基于传统电互联方案的单集群上限约为128张GPU卡。昇腾950直接把这一数字拉到了1024。
但华为并非孤例。WAIC上,几乎所有国产算力厂商都把超节点摆在了展台最醒目的位置,从中兴通讯、壁仞科技、燧原科技、沐曦股份,到中科曙光、阿里云、百度智能云。
阿里云发布了灵骏真武M890超节点实例,首次通过公共云对外提供超节点形态的AI算力服务。壁仞科技推出支持单个超节点1024卡扩展的NPO光互连方案。
多家机构将2026年称为“国产超节点方案量产元年”。据华泰证券测算,2028年国产超节点市场空间有望达到3414亿元,2026年至2028年复合年均增长率高达194%。
资本市场已经给出了回应。7月1日到22日,紫光股份股价累计上涨58%,浪潮信息上涨41%。超节点正在成为新的“造富机器”。
为什么巨头们都在疯抢超节点?
道理很简单:算力需求正在从“单机八卡”向“万卡/十万卡”的集群演变。但传统的“堆卡”思路,已经走到了尽头。
GPT-5级别的大模型训练,跨节点通信开销占了总训练时间的三成以上。也就是说,买100张卡的钱,有30张卡的时间在干等数据。
GPU算力每年提升2到3倍,但内存带宽一年只涨15%到30%,两者之间的差距越来越大。
单颗芯片的性能快到天花板了。算力规模要继续做大,只能靠一件事,就是把更多芯片用更快的方式连起来。这就是超节点在做的事情。
一位服务器厂商高管直言:目前公司和互联网公司客户谈的都已是2027年、2028年的供货。“互联网客户第一句话就是,你有10万片的供应,我们再谈。如果你没有,我们就先不浪费时间了。”从2026年下半年到2027年,超节点都会呈现出快速上量的趋势。
某算力公司高管透露:超节点的价格比传统服务器要贵50%,利润比单卡利润要高,但其性能可以提升10倍,“客户能算过来账”。
这背后的商业逻辑已经彻底改变。大模型训练的高峰期过后,行业焦点正加速转向推理落地和智能体应用。算力的性质从一次性采购的固定资产,转变为持续性的运营支出。
单位Token的推理成本、毫秒级的响应时延,成为决定商业模型能否跑通的关键指标。
燧原科技董事长、CEO赵立东对作者表示:“AI Agent等智能推理应用快速爆发,推理算力需求将达到训练算力的10倍甚至100倍。”
行业对芯片的评判标准已发生转变,业界不再单纯追逐芯片峰值算力,单位Token成本、综合性价比成为关键。
超节点正是在这个转折点上被推向了舞台中央。
超节点是唯一的答案?
如果说大模型训练是算力需求的“第一次爆发”,那么AI智能体的规模化落地,就是算力需求的“核爆”。
为什么?因为智能体(Agentic AI)的工作方式,彻底改变了算力的消耗逻辑。
传统大模型推理是“一次请求、一次回答”。而智能体是在更长上下文中持续执行规划、检索、调用工具、写入记忆和结果验证。模型不再只是回答问题,而是在“干活”。
首先是上下文疯狂膨胀。 Agent多轮对话中的工具调用会带来三倍以上的上下文膨胀。长上下文推理的KV Cache从64K到1000万token时,容量需求从百GB级跳升至TB级。
单用户单次对话可产生约10GB KV缓存,千级并发场景总量可达1TB,上万用户规模下整体缓存容量突破百TB。
即便通过算法将KV占用压缩90%,海量长会话累积的数据量仍远超传统内存承载上限。
其次是存储需求结构性重构。AI推理对硬件提出三项核心需求:更高的每秒查询率、更长的上下文窗口,以及更多的推理步骤和智能体循环。
这三项需求分别从不同维度驱动内存需求的结构性变化,具体体现在模型权重、KV缓存与智能体AI三个层面。
IDC数据显示,2026年全球数据总量将达274ZB,2030年将飙升至718ZB。存储从AI产业的“辅助配套”变成了“核心底座”。
最后是并发和协同呈指数级增长。多个智能体同时工作,会把吞吐量、响应时间和服务稳定性一起推向极限。长上下文推理需要频繁读取和移动数据,连续调用工具会增加CPU任务,分布式推理不断扩大KV缓存。
AI的挑战已不再是单纯的GPU算力问题,而是算力、内存与存储如何协同的架构设计问题。
而超节点,正是为解决这个问题而生。
超节点的核心优势在于:它通过跨物理节点的统一内存编址,让不同节点的内存被纳入同一个地址空间。
这意味着海量的KV缓存、智能体的长期记忆、频繁调用的上下文数据,都可以在一个统一的逻辑空间内高效流转,无须在各个节点之间反复搬运。
正如一位业内人士所说:“一个机柜甚至几个机柜组成一个超节点,其中有独立软件、存储,它们需要架构解耦,这样才能避免资源的浪费。”
英伟达的Vera Rubin平台已经在这方面给出了示范,其部署在5类机架中,多机架组网形成统一POD级AI超算集群,分工覆盖GPU计算、CPU计算、低时延推理、上下文存储和网络互联,并作为一台AI超级计算机协同运行。
推理上下文记忆存储平台可扩展AI智能体的长期记忆,实现机架规模AI系统集群之间的高带宽上下文共享,将每秒处理的token数量和能效提升高达5倍。
这就是超节点在智能体时代的真正价值,它不是简单地提供更多算力,而是重构了算力、存储、内存之间的协作方式,让智能体能够在海量数据、超长上下文、多轮协同的复杂场景中高效运转。
结语
回顾这场算力战争的全景,一条清晰的逻辑线已经浮现:
算力短缺是表象,算力组织方式落后是本质。当单芯片逼近物理极限,当“堆卡”遭遇通信瓶颈,当智能体带来指数级的数据和上下文需求,传统的算力供给模式已经彻底失效。
超节点不是锦上添花,而是必由之路。它通过系统级的架构创新,超大带宽、超低时延、统一内存编址,它能把成百上千张芯片变成“一台计算机”,让算力、存储、内存在一个统一的逻辑空间内高效协同。这不仅是算力规模的提升,更是算力效率的质变。
智能体的未来,取决于超节点的普及程度。智能体需要储存、需要知识库、需要上下文缓存、需要处理海量数据,而所有这些需求,都在指向同一个答案:超节点。
没有超节点,智能体就无法规模化落地;没有超节点,万亿参数模型就无法高效推理;没有超节点,AI从“聊天”走向“干活”的产业跃迁就无从谈起。
华为在WAIC上提出了一个目标:“像一台计算机一样工作”。这恰恰揭示了超节点的本质,因此它不是一堆服务器拼在一起,而是一台真正的“计算机”。
当资本市场的恐慌与产业界的狂飙在同一时空交错,当数千亿美元的资本开支涌向同一个方向,当所有科技巨头都在疯抢同一种东西——答案已经不言自明:
AI智能体的未来,是算力。
而算力的关键点,便是超节点。







快报
根据《网络安全法》实名制要求,请绑定手机号后发表评论