当几乎所有AI公司都在拼命租云端GPU、日烧千万美元的时候,苹果在桌面上放了一颗“核弹”——它以2纳米制程的M6芯片和四晶粒架构的M5 Ultra,把本地大模型算力的天花板直接掀翻了。
2026年8月25日,苹果未开发布会,直接上架了两款全新自研芯片M6与M5 Ultra,以及搭载它们的新款Mac mini与Mac Studio。这不是一次常规的产品迭代。在苹果CEO蒂姆·库克卸任前夕,这家公司用两枚芯片向整个AI行业传递了一个清晰的信号:真正的AI算力,不一定非要在云端烧钱。
两枚芯片,两套哲学
先看M6。
这是苹果首款2纳米制程的M系列芯片。12核CPU包含2颗超级核心、4颗性能核心和6颗能效核心,单线程性能号称“全球最快”。12核GPU每颗核心都集成了神经网络加速器,AI峰值算力较M5提升近30%,较M1提升超过8倍。最关键的升级是双16核神经网络引擎——这是苹果首次在一枚消费级芯片上部署双神经引擎,系统框架可同时自动调用两个引擎,峰值计算性能较前代最高可达2倍。
数据是最有力的语言。苹果官方数据显示,搭载M6的Mac mini处理大语言模型提示词的速度,比M1版Mac mini最高快13.5倍,比M4版最高快4.8倍。统一内存带宽最高170GB/s,较M5提升10%,是M1的2.5倍。虽然不及M5 Ultra那样夸张,但对一台起售价899美元(国行6,999元)的桌面电脑来说,这个数字意味着本地跑大模型不再是“玩票”。
Mac mini的角色也在悄然变化。M6版起售价比M4版贵了1000元(国行价格),苹果显然不再满足于让Mac mini扮演“最便宜的Mac”那个角色。它正在成为AI时代的新入口。
如果说M6是一次教科书级的制程迭代,那么M5 Ultra则是苹果芯片史上的一次“暴力美学”演出。
M5 Ultra通过新一代UltraFusion封装技术,将两颗双晶粒M5 Max芯片连接起来,形成M系列SoC中的首个四晶粒架构。晶粒间带宽超过4.4TB/s,连接密度提升逾6倍——四颗晶粒在运行表现上如同一颗统一处理器。最终规格:最高36核CPU(12颗超级核心加24颗性能核心)、80核GPU、32核神经网络引擎、最高512GB统一内存、1.2TB/s统一内存带宽。
每一项数字都让人倒吸一口气。AI GPU峰值算力较M3 Ultra提升4.5倍,较M1 Ultra提升超过6倍。统一内存带宽较M3 Ultra提升50%。512GB的统一内存意味着什么?意味着数千亿参数的大语言模型可以完全在本地运行,海量数据集完整存储在本地内存中,数据不出设备。
这不是“跑起来”的概念,而是有了本地化部署大型模型的实际能力。一台搭载M5 Ultra的Mac Studio(起售价5,499美元,国行46,999元)就能完成此前需要租用多块云端GPU才能做的事。如果还不够,苹果还提供了“集群方案”:支持通过Thunderbolt 5和远程直接内存访问组成多机低延迟网络,4机集群的推理性能最高可达单机的3倍。
苹果打出的“反共识牌”
在AI行业的主流叙事中,“算力”几乎是云端的同义词。OpenAI租微软的Azure,Anthropic租谷歌云,xAI在孟菲斯建十亿美元的算力集群——所有人都默认:AI大模型必须在云端运行。
苹果的选择恰好站在了这套叙事的对立面。
M6的双16核神经引擎、M5 Ultra的80核GPU加1.2TB/s带宽加512GB统一内存组合,共同指向一个判断:苹果认为大模型的未来不是纯云端的,而是“本地加云端”混合的。在本地做推理,在云端做训练——或者在某些场景下,全部在本地完成。
这套逻辑有其现实基础。过去一年,端侧大模型的可用性正在快速提升。从Meta的Llama 3到Mistral,从DeepSeek到苹果自己的基础模型,模型压缩和量化技术的进步,让数十亿参数级的模型在消费级硬件上流畅运行不再是天方夜谭。苹果在开发者活动中已经展示过类似方向——Mac Studio集群通过远程直接内存访问实现多机协作推理,预演了桌面级AI算力的演进路径。
更重要的是隐私和安全。苹果从iOS 18开始就反复强调“设备端处理”的哲学——AI不在云端看你照片、读你消息、分析你的健康数据。M5 Ultra的512GB本地内存为这个承诺提供了硬件基础:大模型可以完整在本地跑,数据不出设备。
对企业级用户而言,这还意味着另一层价值:成本控制。一台5,499美元的M5 Ultra Mac Studio,如果能够本地运行数千亿参数级别的大模型推理,长期来看其总拥有成本可能远低于持续租用GPU实例。苹果的开发者工具和框架——Core AI、Core ML、Metal、Xcode——可以直接利用这些芯片的先进硬件,开发者无需特殊适配即可获得性能提升。
当然,这套逻辑也有它的边界。训练依然依赖云端,这是物理法则决定的。M5 Ultra的80核GPU在AI推理上碾压前代,但和英伟达H100或B200的并行计算能力相比,完全不在一个量级。苹果押注的是“推理本地化”的未来,而非全栈替代。
库克的“收官之作”与苹果芯片的五年征程
这批产品的发布时机还有一个不能忽略的注脚。
蒂姆·库克即将卸任苹果CEO。M6和M5 Ultra是他任期内的最后一代M系列芯片。从2020年M1的横空出世,到2026年M5 Ultra的四晶粒架构,苹果用不到六年时间完成了从Intel依赖到自研芯片完全主导的转型。
这段历程的数据令人震撼:M1的单线程性能当时就已领先同期Intel酷睿i9,同功耗下性能翻倍。到M5 Ultra,苹果已经在单一SoC中集成了36核CPU和80核GPU,内存带宽从M1的约100GB/s飙升至1.2TB/s,涨幅达12倍。GPU AI算力从M1 Ultra到M5 Ultra更是跨越了超过6倍的代差。
更值得关注的是,苹果在这些芯片上做到的AI性能断层式跨越,实际源自架构工程而非单纯依赖先进工艺。M6通过双神经引擎设计使AI算力翻倍,同时利用2纳米工艺带来的密度红利;M5 Ultra则通过四晶粒互联实现了跨代际的算力飞跃——这与传统依赖堆算力的路径有着本质区别。
但这场“芯片霸权”的代价也在产品价格中清晰可见。M6 Mac mini国行6,999元起,较M4版涨了1,000元。顶配Mac Studio Ultra(256GB加16TB)国行售价142,999元,512GB内存版本要到10月下旬才发售。苹果正在用价格上涨测试用户的“AI溢价”接受度。
谁会紧张?谁会受益?
M5 Ultra的桌面算力怪兽登场后,英特尔和AMD显然是最紧张的。在桌面端,M5 Ultra的AI算力已经和x86生态拉开了代差距离。英特尔刚刚通过Lunar Lake追赶AI PC概念,AMD的Ryzen AI正在发力,但苹果凭借着统一内存架构——CPU、GPU、神经引擎共享同一个内存池——构建了本地大模型推理场景中竞争对手难以复制的优势。
英伟达则不会太担心。它的战场在云端和数据中心。但苹果正在低端桌面AI推理这个领域建立堡垒:Mac的庞大用户基数和macOS的开发者生态,意味着越来越多的AI开发者会在本地用Mac做原型验证,而不是一上来就租A100或H100。
对AI应用开发者而言,M5 Ultra的512GB统一内存和1.2TB/s带宽打开了一扇新的大门——本地推理大型模型的体验可以接近云端实时交互的流畅度,无需担心API延迟、数据隐私和按Token计费的成本压力。苹果的MLX框架和Core ML工具链进一步降低了开发者将模型部署到本地的门槛。
对普通消费者而言,搭载M6芯片的Mac mini可能是他们第一次真正意义上在日常使用的设备上跑大语言模型。苹果让这件事变得简单——不需要装Linux、不需要NVIDIA驱动、不需要CUDA配置。开箱即用,这就是苹果生态的壁垒。
但这条路径也有其隐忧。统一内存架构虽然消除了CPU与GPU之间搬运数据的开销,但内存容量直接锁定模型上限——32GB的M6最多运行70亿参数级别的量化模型,512GB的M5 Ultra才能触及千亿参数级别。苹果通过不同的内存配置制造了清晰的产品分层,这也意味着用户需要为AI能力支付越来越高的溢价。
尾声
苹果选择在库克离任前抛出M6和M5 Ultra这两枚芯片,不是巧合。
M6用2纳米制程和双神经引擎证明,消费级芯片也能跑大模型。M5 Ultra用四晶粒架构和512GB统一内存证明,本地AI算力的天花板远未到来。
在“一切都上云”的行业狂热中,苹果低声说了一句反话:真正的智能,也许不需要联网。
这一刻,个人计算机正式跨入了端侧大模型算力时代。






快报