从端侧推理到物理AI,芯片行业正面临新考题

AGI
物理AI的时代,比拼的将是谁的落地更稳。

过去两年,几乎所有关于AI的讨论都围绕一个词展开:规模。更大的模型、更多的参数、更贵的训练集群。但2025年到2026年之间,风向悄悄变了。物理AI、端侧AI逐渐成为AI应用的落脚点,产业界谈论的焦点正在从AI能做什么,转向AI能落在哪里、怎么落地、由谁来承载。

当AI从数据中心走向口袋、车间和街头,它面对的不再是稳定的供电、充沛的带宽和恒温的机房,而是有限的电池、时断时续的网络和严苛的实时性要求。

场景优先的端侧AI走到了哪一步?

根据CounterPoint Research的统计,2025年全球人形机器人装机量中,中国占比已超过80%;IDC的数据则显示,2025年中国具身智能机器人用户支出规模约为14亿美元,预计到2030年将达770亿美元,年均复合增长率约94%。把镜头从机器人拉回到更广义的端侧AI,渗透的速度同样在加快。IDC 的统计口径下,2025 年全球AI PC出货量约1.14亿台,渗透率约43%;Gartner 预计 2026 年这一数字将升至约1.43亿台,渗透率超过 55%。换句话说,AI正在从数据中心里那种问答形态,变成部署在人们生活中各种场景中的形态。

但在英特尔公司副总裁兼端侧计算和物理AI事业部中国区总经理高嵩看来,物理AI与以大模型为代表的数字AI,有着本质的不同。“从数字AI到物理AI,出现了一些新的变化。数字AI有相对固定的套路,但物理世界没有统一的形态,行业不同、场景不同、任务不同,催生了千变万化的全新机遇,”高嵩指出。

高嵩将这种不同概括为“千变万化”。数字AI可以在互联网上低成本地收集海量数据,把几千年前的历史都“喂”进训练集;但物理世界的历史你看不见,边缘的世界也不容易获取。更麻烦的是,物理AI不能只做一件事,比如现在困扰很多具身智能企业的一个事实:在某个场景训练好的机器人,换个环境就失灵了。

Figure AI最近发布的一项研究恰好印证了这一点:通过特殊的训练方法、不同的数据采集方式和模型架构,机器人进入未经训练的新场景的成功率可以从9%提升到56%。从9%到56%是巨大的进步,但距离“可部署、可复制、可量产”,依然隔着相当的距离。

端侧AI的故事则更为现实。英特尔行业及解决方案业务部总经理王景佳与我们分享了一个具体的例子:汽车导航场景。现在很多车都可以完成语音问答和交流,但团队近期在川西发现,导航可能存在不工作的情况,再碰上复杂的路况,用户体验会受到明显影响。“对于许多行业场景而言,无网或弱网环境下仍能稳定运行,是一项重要能力。”王景佳强调。

随着云端大模型的吞吐效率越来越高、Token单价持续下探,一度有观点认为,端侧AI的性价比优势正在消失。但一线的实践给出了不同的答案。视源股份商用显示BG副总裁王玉龙算了一笔账:Token的单价确实在降,但真正要输出好的效果,需要的上下文在快速扩张。“以前的Token是一句话的Token,现在一句话后面要带着大量的上下文,所需的Token数量是快速增长的。”他透露,视源自己每月的AI账单就“非常恐怖”。在端侧部署算力,可以极大降低用户的真实使用成本,也为隐私数据安全提供更好的保障。

当然,除了成本之外,端侧部署的另一个好处就是安全可靠。以零售场景为例,商米科技执行董事、产品线总经理陈桂鸿告诉我们,门店运营管理里,点餐时用户希望商品能及时加入购物车进入结算流程,如果完全依赖云端服务,就会受到网络带宽和稳定性的影响。

而在数据安全和实时性之外,端侧还有隐私的刚需。视源股份的“课堂观察”产品就是典型:学生是未成年人,未成年人隐私受法律严格保护,所有课堂采集的数据都在班里做预处理,上传云端的是脱敏后的数据。

于是,一个越来越清晰的共识正在产业链上形成:云、边、端不是替代关系,而是融合关系。

而物理AI,则把这种融合推向了更极端的形态。高嵩举了一个客户的故事:一家电能领域的公司,面临装配的难题,机器人要模拟一个空间的仿真,根据仿真结果规划整个安装流程,比如需要先拧一根线缆,下一个螺丝才有空间将工具伸进去。客户的要求是在做硬件设计、画电路板和元器件选型的时候,就要同步仿真。这实际上是把所有后端的工作放到前端来做了,“物理AI对算力和工作流的要求,正在向前所未有的深度和广度蔓延。”高嵩如是说。

端侧AI给芯片出了新题

端侧AI、物理AI的发展,一方面是带来了更大的产业机会与市场空间,另一方面,也是给芯片厂商出了新考题。

第一道题就是带宽与距离成本。AI推理的瓶颈,往往不在算力本身,而在数据搬运。Imagination CEO Markus Mosen(马库斯·莫森)用了一个形象的比喻:把GPU、DSP、NPU等专用加速器塞进SoC,各个部件之间要通过外部内存来回传数据,而外部内存是昂贵的。马库斯·莫森将这种昂贵的数据通信叫作"边境税",每个部件像一座孤岛,孤岛之间用最贵的方式连起来。神经渲染就是这种距离成本最好的例证:GPU出图形数据,AI再把这份数据加工成更高分辨率的图,如果图形和AI完全分开、各自写回DDR再读出来,代价极高。

Imagination给出的解法,是让AI直接"长"进图形管线,而不是放在总线另一端。NSR(Neural Super Resolution,神经超分辨率)技术走的就是这条路:GPU先渲染出低分辨率画面,再由片上AI把画面放大到高分辨率,中间数据不必在GPU和外部内存之间来回倒腾。以540p到1080p的超分为例,在1GHz单核E系列GPU上延迟低至2.3毫秒;与原生渲染相比,NSR在显著提升帧率的同时,把内存带宽消耗直接减半。同样一帧高清画面,只用一半的带宽就拿到了。"边境税"就此被省下一大截。

第二道题就是prefill(预填充)与decode(解码)之间的取舍。本地大模型,工作负载要分预填充、解码两个阶段。最重要的是prefill要在尽量短的时间里给大模型处理海量数据,衡量指标是Time to first token(TTFT)(也就是处理器听懂你的问题、开始吐第一个token要多久)。Imagination给出的实测数据颇具代表性:车载规划行程,TTFT大概0.2秒、150 tokens/s;盲人智能眼镜描述周围环境,TTFT约0.25秒、153 tokens/s;邮件解读和摘要,TTFT 0.86秒、约126 tokens/s。而decode阶段则取决于系统带宽——这也解释了为什么AI不只是看TOPS,系统带宽受限时,更多TOPS解决不了系统问题。

第三道题就是综合能力的平衡。王景佳总结了过去两三年客户合作中最深的体会:“早期讨论云边端协同、端侧AI,更多是从AI技术本身出发。但是我们越来越发现端侧AI部署不仅是成本问题,而是需要综合考虑服务器、时延、响应、成本、隐私安全等多个维度。”尤其在中国独特的商业和技术生态中,越来越多的商业场景客户,会更依赖边缘部署或云边端混合部署。

比如,端侧设备不是算力越大越好,而是要匹配场景。针对此,王玉龙与我们分享了视源应用的经验:在视源的课堂观察场景,本地只需要用一个小模型进行快速处理,“32-48TOPS基本可以满足本地需求,没有必要部署一个特别大规模的模型,”王玉龙指出。这种够用就好的思路,正在倒逼芯片厂商提供更细颗粒度的产品组合。

此外,端侧设备不同于数据中心内部的设备,其所处环境不尽相同,“行业场景与传统消费级场景也存在差异,例如7×24小时运行、低功耗、防尘、防震、电磁兼容等各个方面,这些并非仅靠传统终端设备即可完全满足。”王景佳指出。同时,智能体的兴起改变了工作负载的结构:一方面,推理需求越来越多,从训练到推理,很多工作负载在推理侧产生已经成为现实;另一方面,在整个智能体的部署、调度和运行过程中,会涉及大量由CPU承担的操作和处理——这一趋势在云端、消费级、企业级以及行业场景中都有所体现。

混合式AI时代来了

面对新考题,英特尔给出的答案是:通过XPU为分层的负载准备分层的算力。端侧的工作负载已经高度分层,智能体的编排调度压在CPU上,视觉感知这类专用负载适合NPU,世界模型和VLA这类大模型推理则需要GPU的矩阵运算能力。王景佳指出,这正是英特尔近年来押注XPU架构的原因:“我们发现有不同物理AI场景对于计算能力有不同的要求,这也是我们近年来观察到XPU架构较适用于物理AI和边缘AI场景的原因之一。”英特尔要做的不只是提供一颗颗单独的芯片,而是让同一套软件框架对不同的计算组件进行统一编程、调度,发挥最大效率。

而这个思路目前已经有成功的案例。在近日举办的Intel Connection上,英特尔分享了与派兹互连的合作。双方以英特尔Agent Box的方式,为客户提供了软硬件一体的解决方案:基于CPU加GPU(锐炫Pro B70)的配置,根据客户的并行情况和工作负载情况重新调校模型、做模型适配和算法调校。

而与之相应的,英特尔这两年在混合AI方面也进行了诸多尝试。再被问及英特尔未来一到两年的核心规划时,王景佳给出了两个方向:“第一,混合AI的趋势越来越清晰了,客户随着技术发展需要更大算力的产品,需要一个更均衡的产品,需要在设备侧、端侧、云侧有一个完整的可以调度不同算力、不同需求的解决方案。第二,AI行业发展非常快,芯片行业是一个硬件行业,它如何快速迭代去跟进这样一个快速的发展,这也是我们的重点,包括和生态的协同”。这两个方向,恰好对应了“云、边、端如何分工”的行业难题。

如果说数字AI的时代,比拼的是谁的模型更强,那么物理AI的时代,比拼的将是谁的落地更稳。正如高嵩所说:“AI不能只停留在口头上。我们想要做的事情在物理AI上就是把它落到实处。”

(文|Leo张ToB杂谈,作者|张申宇,编辑丨杨林)

本文系作者 Leo张ToB杂谈 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接。
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里。

敬原创,有钛度,得赞赏

赞赏支持
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

请 登录后输入评论内容

扫描下载App