高通在GPU里塞了3个AI核心:手机芯片的游戏规则正在被改写

2026.09.03 08:19
高通在Hot Chips 2026上披露了新一代Adreno GPU的架构细节,首次加入3个专用矩阵核心,专门负责AI任务处理。这延续了此前在CPU中加入SME矩阵运算技术的思路,标志着手机芯片AI计算从单一NPU加速走向全域硬件并行的关键转折。文章分析这项技术对移动端AI画面升频、手游画质变革的意义,以及高通在终端AI算力竞赛中的战略布局。

2026年9月,高通在 Hot Chips 大会上放出了一张架构图。图上最引人注意的是三块不起眼的小方块,标注为“Adreno Matrix Cores”。这三个小方块背后,是智能手机芯片设计的一次关键转向。AI 算力正在从专用 NPU 进一步下沉到 GPU 的最底层硬件。

一年前,高通在 Oryon CPU 中加入了 SME(可扩展矩阵扩展)矩阵运算技术,用来加速 AI 计算。一年后,同样的思路被延伸到了 GPU。这不是简单的功能叠加,而是一个清晰的信号:手机芯片的 AI 计算,正在从“专用单元加速”走向“全域硬件并行”。

GPU 矩阵核心来了:高通给自己的移动端 AI 补上了一块拼图

据 Android Authority 报道,高通在公布下一代旗舰处理器的 CPU 升级细节后,进一步披露了新一代 Adreno GPU 的变化。最引人注目的设计是加入了 Adreno 矩阵核心。据高通公布的示意图,GPU 预计配备 3 个矩阵核心,专门负责以更低延迟和更低功耗处理本地 AI 任务。

这些矩阵核心服务于高通新推出的 Adreno 神经融合(Neural Fusion)技术。高通表示,与上一代方案相比,Adreno 神经融合可以减少画面闪烁、重影等瑕疵,让运行表现更稳定、细节更清晰,同时最多降低 40% 的功耗。

对于游戏玩家而言,最直接的变化预计是帧生成和画面升频效果的进一步改善。高通确认,虚幻引擎和 Unity 都支持 Adreno 神经融合。这意味着开发者接入这项技术的门槛不会太高,兼容游戏数量有望迅速增加。

基础规格方面,新一代 Adreno GPU 采用三分片 GPU 架构,频率提升至 1.45GHz,作为对比第五代骁龙 8 至尊版为 1.2GHz。18MB Adreno 高性能内存(HPM)继续保留,高通同时宣称 GPU 能效提升 12%。配合此前确认的最高 5GHz Oryon CPU(智能手机芯片首次跨过 5GHz 门槛)以及新的 FlexCache 架构,第六代骁龙 8 至尊版系列的硬件规格已经相当抢眼。

但规格提升背后的真正问题是:高通为什么要选择在 GPU 中塞入专用矩阵核心,而不是把所有 AI 计算都丢给 NPU?

为什么是 GPU:从画面升频到 AI 渲染的必然逻辑

GPU 的核心任务是图形渲染。过去几年,PC 和游戏主机市场已经证明了一条铁律:AI 驱动的画面升频技术是游戏画质和性能的双重杠杆。NVIDIA 的 DLSS 已经迭代到 4.5 版本,AMD 的 FSR 和 Intel 的 XeSS 也在持续追赶。但在移动端,AI 画面升频技术一直落后于 PC。原因很简单,手机 GPU 缺乏足够的矩阵计算硬件去支撑实时 AI 图像处理。

高通的 Adreno 矩阵核心直接解决了这个痛点。3 个矩阵核心提供了专用矩阵乘法硬件,让 AI 驱动的帧生成和画面升频可以在 GPU 内部以低延迟完成,不再需要将数据搬运到 NPU 再做处理。这种本地化处理的优势是双重的,延迟更低,功耗也更低。高通宣称最多可降低 40%。

本质上,高通用硬件定义了一个移动版的“DLSS”。而虚幻引擎和 Unity 两大游戏引擎的原生支持,意味着开发者不需要从零适配。这恰恰是 PC 端 DLSS 早期推广中踩过的坑,高通这次直接绕过去了。

从专用 NPU 到全域矩阵计算:一条正在清晰的技术路线

手机 AI 计算的硬件架构已经历了三次迭代。

第一次是在 2017 年前后,苹果 A11 Bionic 率先加入 Neural Engine,华为麒麟 970 搭载 NPU。AI 加速被封闭在专用单元中,推理任务需要将数据从 CPU 或 GPU 搬运到 NPU,存在额外的延迟和功耗开销。

第二次是在 2020 年以后,高通等厂商推动异构计算融合。CPU、GPU、NPU 之间的任务调度变得越来越智能,但矩阵运算仍主要依赖 NPU 完成,GPU 在 AI 计算中的参与度有限。

第三次正是高通现在做的事情。先在 CPU 中加入 SME 矩阵运算,再到 GPU 加入 Adreno 矩阵核心。这正在消除 CPU 和 GPU 之间的 AI 计算差距。不论 AI 任务落在哪个计算单元上,都能获得本地矩阵加速,不再需要跨单元搬运数据。

这背后的驱动力是终端 AI 工作负载的爆炸式增长。从相机 AI 场景识别、语音实时翻译,到游戏 AI 画面升频、本地运行大语言模型。AI 计算已经遍布手机每一个子系统。单一 NPU 无法高效覆盖所有场景。把矩阵计算能力分散到每个核心,反而成了更合理的架构选择。

竞争格局中,高通在赌什么

高通并不是第一个在 GPU 中引入矩阵计算的芯片公司。NVIDIA 早在 2018 年的 Turing 架构中就在 GPU 中加入了 Tensor Core。但 NVIDIA 做的是 PC 和服务器 GPU,高通的战场是手机,功耗和面积约束远为严苛。

对手方面,苹果从 A17 Pro 开始持续强化 Neural Engine,但 GPU 端没有类似的专用矩阵核心设计,AI 画面升频更多依赖第三方方案适配。联发科天玑 9600 预计采用下一代 Immortalis GPU,支持硬件级分辨率升频,但其方案尚未披露类似高通的专用矩阵核心细节。三星 Exynos 与 AMD 合作开发的 RDNA 架构 GPU 理论上具备矩阵计算能力,但在移动端的落地进展相对缓慢。

高通的策略优势在于,通过将矩阵核心同时部署在 CPU(SME)和 GPU(Adreno Matrix Cores),构建了一个高度协同的矩阵计算生态。开发者可以在两个单元上获得一致的矩阵加速体验,而不需要为不同的硬件架构分别做适配。

但风险同样存在。3 个矩阵核心的真实算力规模、实际功耗表现、开发者的适配意愿,都需要在真机上市后验证。更重要的是,当 GPU 开始承担更多 AI 计算任务,高通自家 Hexagon NPU 的角色定位是否会变得尴尬。这是高通需要回答的内部问题。

终端 AI 的算力民主化

高通的 GPU 矩阵核心不是什么“黑科技”。它是 PC 端已经验证的技术逻辑在移动端的自然延伸。但它的意义恰恰在于这个“延伸”。当 AI 驱动的画面升频和帧生成在手机上成为标配,手游的画质天花板将被大幅推高。而虚幻引擎和 Unity 的官方支持,意味着这个“标配”的到来速度可能比预期更快。

从更宏观的视角看,高通正在执行一条清晰的战略路线:让每个计算单元都具备 AI 能力。这不是技术炫技,而是商业护城河。当开发者的 AI 应用可以在高通芯片的每一个核心上高效运行,竞争对手的追赶成本会越来越高。

真正的考验不在硬件规格,而在功耗和发热。5GHz 的 Oryon CPU、1.45GHz 的 Adreno GPU、再加上三个矩阵核心,第六代骁龙 8 至尊版的功耗控制,将决定高通这套矩阵计算叙事,能否在消费者手中变成真实体验。

AI 算力从 NPU 走向 CPU,再从 CPU 走向 GPU。高通正在做的,不是给手机加一个“AI 加速器”,而是让整颗芯片变成一台 AI 加速器。

作品声明:内容由AI生成