从2024年到2026年,AI算力的故事全在云端——英伟达H100集群扩建、微软千亿美元数据中心、OpenAI的Stargate超级计算机。但当所有人都在仰望云端的千卡集群时,一场逆流正在桌面发生。
2026年9月4日,柏林IFA展台,AMD高级副总裁Jack Huynh揭开了Threadripper Halo Station的面纱。这不是又一台普通的Windows工作站。这是一台被AMD称为“个人超级计算机”的机器——96核Threadripper PRO处理器、两块Instinct MI350P加速卡、最高2TB系统内存,目标直指一个看似矛盾的任务:在桌面上本地运行万亿参数级别的大模型。
在英伟达DGX Station刚启动交付、定价超过10万美元的当下,AMD正在用另一种思路回答同一个终极问题:个人,到底能不能拥有自己的T级AI算力?
一台“桌面核弹”的数据牌面
Threadripper Halo Station的核心配置可以用三组数字概括。
第一组:96核Zen 5架构的锐龙Threadripper PRO 9995WX处理器,192线程,最高5.4GHz加速频率,384MB L3缓存。这颗CPU的官方定价达到11,700美元,拥有服务器级EPYC核心的底子,却装进了一个工作站可用的封装。
第二组:两块AMD Instinct MI350P PCIe加速卡。这是AMD在2026年重返PCIe加速卡市场的标志性产品,每块配备144GB HBM3E内存、4TB/s峰值带宽、2,300 TFLOPS FP8算力。双卡合计288GB HBM3E、8TB/s聚合带宽——这个容量已经超越了英伟达单颗B300 Blackwell Ultra的配置。
第三组:最高2TB DDR5系统内存,采用8通道6400MT/s配置。所有核心计算组件全部液冷散热。AMD还表示未来可升级至4卡,届时HBM3E总容量将达到576GB。
对比英伟达DGX Station——搭载Grace CPU(72核Arm架构)+ B300 Blackwell Ultra GPU,GPU端HBM3e容量252GB,整机统一内存748GB(含Grace CPU的496GB LPDDR5X),售价从94,930到123,000美元不等——Threadripper Halo Station在x86兼容性、显存扩展性和成本结构上形成了自己的竞争力。
这不是AMD第一次打“本地AI”牌。2026年初CES上,苏姿丰发布了Ryzen AI Halo——基于Strix Halo APU的小型AI工作站,最高128GB统一内存,定价约4,000美元,对标英伟达DGX Spark。Threadripper Halo Station是这条产品线的向上延伸,两条线构成了AMD从轻到重的完整本地AI算力矩阵。
本地推理:从边缘需求到主流叙事
2026年,大模型的参数规模正在经历质变。DeepSeek V4总参数达到1.6T,Kimi K3达到2.78T,Qwen3.8-Max达到2.4T。千亿参数已是“入门”,万亿参数才是“标配”。
然而令人意外的是,这些动辄万亿参数的模型,实际运行时的显存需求并不随总参数线性增长。MoE(混合专家)架构的普及使得推理时每个token仅激活模型的一小部分参数——以OpenAI开源的GPT-OSS 120B为例,总参数117B,但每次推理仅激活5.1B参数。这就是为什么一块144GB HBM3E的MI350P可以运行此前被认为需要多卡服务器才能跑得动的模型。
Threadripper Halo Station的核心逻辑就在于此:两块MI350P提供合计288GB HBM3E,加上2TB系统内存可作为KV-Cache溢出或CPU推理缓冲,使在一个桌面的物理空间内运行总参数超1T的MoE模型成为可行。
更深层的变化在推理需求本身。据市场报告,2026年企业级AI推理请求中已有42%从云端迁移至本地。数据隐私、延迟控制、法规合规——这三个驱动力正在把越来越多AI工作负载从数据中心拽回到本地设备上。
英伟达的封闭牌桌与AMD的绕路策略
英伟达并非没有看到本地部署的趋势。DGX Spark(约4,000美元)和DGX Station(10万美元级)构成了英伟达的本地AI产品矩阵。但英伟达的策略有一个根本特点:一切围绕自家封闭生态。
DGX Station搭载的是Grace CPU——基于Arm架构。这意味着数百万行现有的x86代码无法直接运行。而AMD的方案保持x86兼容性,没有架构迁移成本。
另一个关键差异在于扩展性。DGX Station的GPU封装在Grace-Blackwell超级芯片中,HBM3e容量固定为252GB,不可扩展。AMD采用标准PCIe接口,支持从双卡升级到四卡,HBM容量可从288GB翻倍至576GB——这是在英伟达封闭架构下做不到的灵活性。
但定价将是AMD面临的第一道考题。MI350P单卡实际采购价在30,000到35,000美元左右,双卡配置下核心部件成本已经接近一套完整DGX Station的售价。如果定价不能明显低于英伟达,x86兼容性和扩展性是否足够吸引客户买单?
这台机器不是万能药
Threadripper Halo Station有其明确的边界。双卡288GB HBM3E够跑大部分1T以内的MoE模型推理,但对于需要完整加载全量参数的稠密模型或大规模多卡并行训练,算力远远不够。整机功耗保守估计超过2,000W,需要专门的供电和散热——它本质上是一个装进塔式机箱的服务器。
但定位精准才是关键:这台机器的主场是推理密集型工作流——本地Agent部署、私有数据推理、延迟敏感的AI应用开发。当一个AI团队每周在云端跑数TB token的推理任务、每月API费用持续攀升时,一台本地T级推理工作站的成本账是算得过来的。
Threadripper Halo Station的出现标志着本地AI算力市场的一个关键转折:在“云端千卡集群”和“消费级本地部署”之间,一个全新的中间地带正在形成。这个地带的需求正在快速膨胀:42%的推理请求回到本地,MoE让万亿参数模型可以瘦身运行,AI Agent的爆发让每个企业都需要本地实时推理能力。
英伟达的DGX产品线已经抓住了这个市场的一角。AMD则在用x86兼容性、PCIe可扩展性和灵活性试图拿回主动权。这不是一场胜负很快揭晓的竞争。但一个判断可以下了:2026年,“个人AI超算”从一个营销概念,正在变成真实且有需求支撑的细分赛道。Threadripper Halo Station是这条赛道上绕到英伟达背后的一张牌——它赌的不是打破云端霸权,而是在云端的阴影之下,用桌面照亮那些被忽视的本地推理需求。
云端算力决定AI的上限,但桌面算力决定AI的渗透率。这台机器不是在挑战云,而是在定义云的边界。






快报