2026 itvalue文章顶部

存储成了AI落地最大变量,企业如何打破阻碍?丨ToB产业观察

AGI
推理已经成为吞噬算力的黑洞。

客服是目前AI应用最广的一个场景。在客服场景中,存在大量重复或相近的问题,这也给本地推理部署带来了巨大挑战,尤其是缓存系统。

按照传统的大模型工作方式,每一个请求GPU都要把系统提示词和历史对话重新计算一遍。这意味着,宝贵的算力被浪费在了“算已经算过的东西”上。

随着大模型从实验室走向生产环境,一个曾经只属于学术讨论的话题被推到了产业前台:推理已经成为吞噬算力的黑洞。

推理时代的“显存墙”

大模型推理的过程,简单来说分两步。第一步是Prefill(预填充),模型把用户的问题“读懂”,生成一堆缓存(也就是KV Cache)。第二步是Decode(解码),模型一个字一个字往外蹦答案。问题在于,多轮对话里大量的问题是重复的,每一次重新Prefill都是在浪费算力。

所以业界早就形成了一个共识:用存储空间换计算时间,把重复生成的KV Cache存下来,下次直接调取。听起来很合理,但执行起来遇到了一堵实实在在的墙,那就是“显存墙”。

GPU的HBM(高带宽内存)容量有限,且成本很高。KV Cache随着上下文长度和并发请求数线性增长,很快就能把显存撑爆,对此,中科曙光分布式存储产品部总经理石静告诉我们,KV Cache在推理过程中的内存开销可以达到数十乃至数百GB,远超单张顶级GPU的显存容量。显存一满,GPU算力再强也转不动,新的请求进不来,正在处理的请求开始卡顿。

东方证券在行业深度报告中判断,AI算力中心的核心挑战已从之前算力为主,逐步转向存储与带宽为主。无独有偶,SEMI中国总裁冯莉在今年3月的演讲中披露,2026年全球AI基础设施支出将达到4500亿美元,其中推理算力占比首次超过70%。她同时判断,全球存储产值将在2026年首次超越晶圆代工,成为半导体产业的第一增长极。

在此背景下,存储正在从一个“配角”,转变为决定推理性能的关键因素。

石静与我们分享了一个更具体的例子:AI智能体在工作时会频繁调用相同的工具包和数据源,KV Cache的重复利用率极高。但如果没有合理的卸载机制,所有KV Cache都挤在HBM里,显存很快被撑爆。“表现就是吐字延时非常高,响应卡顿,用户体验很差。”石静指出。企业面对这种情况,通常只有两条路:要么买更贵的、显存更大的高端GPU,要么就只能眼睁睁看着业务并发上不去。

存储进化方向

解决显存墙,理论上只有两条技术路线。一条是在算法层面压缩KV Cache的体积,从源头上减少数据量。另一条是把KV Cache从HBM里搬出来,放到容量更大、成本更低的存储介质上,比如CPU的DRAM或者本地SSD,再或者分布式存储。

这其中,第二条路径已经成为厂商重点布局的路径。开源的LMCache可以在GPU、CPU和本地磁盘之间灵活存储KV Cache。实测数据显示,在多轮问答和RAG场景中,LMCache能实现3~10倍的延迟降低。谷歌云也在2025年推出了基于Managed Lustre的外部KV Cache方案,据披露数据显示,该方式可将TCO降低35%,用大约40%甚至更少的GPU支撑同样的工作负载。

这些方案虽然能够一时解决显存墙的问题,但他们都有一个比较明显的瓶颈:大多是“单机版”。对此,石静告诉我们,LMCache虽然能破除KV Cache的实例级隔离,但在HBM、DRAM、Local SSD三级仍存在较大程度的节点级资源孤岛。

这就带来了两个问题,一个是资源利用率低。A节点缓存的KV Cache,B节点用不了,只能各自重新计算,这也又导致集群应用下,算力的浪费。另一个是元数据管理混乱。模型推理引擎、框架原生组件、第三方KV组件各有各的元数据管理方式,三层嵌套,缺乏全局视角。石静管这叫“元数据迷雾”,“没有全局视角,就没办法判断什么时候该把KV Cache放到哪一个层级。”石静强调。

此外,更为“致命”的问题在L4层(分布式存储层)。理论上,分布式存储天然适合做KV Cache的池化共享,因为其容量大、成本低、可跨节点访问。但现实是,分布式存储的强一致性锁机制带来较大的延迟,导致它长期被当作“冷数据仓库”使用。

也就是说,KV Cache的分层管理在L1~L3(HBM、DRAM、本地SSD)已经有了不错的实践,但到了真正能实现大规模池化共享的L4层,反而卡住了。分布式存储的性能不够好,延迟太高,无法直接参与推理的实时数据流动。

正是看到了这个卡点,中科曙光在2026中国国际大数据产业博览会(数博会)期间发布了ParaCache。据石静介绍,ParaCache的核心思路是将KV Cache的管理从单机扩展到集群,从四个层级(L1 HBM、L2 CPU DRAM、L3 SSD、L4分布式存储)实现全局池化和动态调度。

当然,这个过程并非“一蹴而就”,实现路径中经历了不少的挑战。首先,在L3层,ParaCache做了一件业界此前没人做过的事——把集中式存储FlashNexus纳入缓存体系。

传统的L3层用的是计算节点自带的本地SSD,存算一体,难以跨机共享,而且SSD盘性能受限于CPU和PCIe通道。FlashNexus Neo是专门为AI推理设计的硬件系列,通过存算解耦实现全局共享,单阵列提供160GB/s带宽能力。实测数据显示,在TTFT、QPS、吞吐量等关键指标上,使用FlashNexus Neo构建的L3缓存池比本地NVMe SSD有接近2倍的提升。

据石静介绍,在L4层挑战更大。ParaStor F9000本身已经是高性能的分布式全闪存储底座(单框提供220GB/s带宽和1000万IOPS)。但光有高性能硬件还不够,ParaCache针对KV Cache的应用方式做了几项定向优化。

第一是数据写入方式。传统分布式存储使用offset覆盖写,ParaCache改成追加写,更有利于降低延迟;第二是锁机制。分布式存储被人诟病最多的就是强一致性带来的延迟,ParaCache在KV Cache场景下做了轻量化处理,可以基于目录去掉分布式锁,或者去除重量的排他锁;第三是在PD分离架构下,只让节点间传输增量KV,节省集群网络带宽。

在全局调度层面,ParaCache提出了一个“Best-effort数据预取”的机制。推理框架调用KV时,会先判断KV是否存在,再调用数据获取,判断与获取之间存在一个时间差。对于已经卸载到L3或L4的冷KV,ParaCache利用这个时间差提前预取。“不用等通知了再去调,而是通过算法提前感知到需要的时候,先把KV调到所需要的层级上,把等待时间化为加速。”石静介绍道。

从测试数据来看,效果是明显的。在多轮对话场景下(30k初始输入叠加20轮对话),ParaCache让首次延迟降低了89%。在多并发场景下,相较于仅使用HBM的方案,吞吐量提升了近26倍。在与头部互联网厂商的在线推理业务合作中,TTFT降低了77%,P99 TTFT优化了84%,吞吐量提升了3倍,缓存命中率提升了5.7倍。

这些数字背后有一个共同的逻辑:企业不需要通过堆叠更多的高性能的GPU,而是通过软件层面的优化,减少GPU花在重复计算和数据搬运上的时间,从而让GPU把更多时间花在真正的计算上。

存储的角色正在被重写

ParaCache的发布,折射出存储行业正在经历变革。赛迪顾问发布的《中国分布式存储市场研究报告(2026)》显示,2025年中国分布式存储市场规模达到289.4亿元,同比增长46%,四年累计增幅177.8%。

但这个市场正在发生结构性的变化。存储不再只是一个存放数据的容器。对此,石静对我们表示,KV Cache正在从“临时状态”变成数据资产。传统的架构里,GPU是中心,KV Cache只是它计算过程中的一个中间产物。但在新的架构下,KV Cache本身是有价值的、可复用的数据,GPU应该围绕这些数据去提供Prefill和Decode的计算能力。

而这个判断将会给存储带来很大的影响。最直接的影响是AI集群的建设思路。以前规划一个智算中心,核心指标是有多少张GPU卡。现在变成了算力、存储、网络乃至缓存的一体化规划。石静表示,现在企业在选择方案时,会更多从TCO成本去考虑,“不再单纯堆砌GPU,而是把SSD和分布式存储都纳入KV Cache管理的考量范围。”石静如是说。

此外,石静也表示这一轮变化也给国产存储的厂商带来了更多的机会。以前存储技术跟随国外,但这两年国内大规模智算中心建设带来了大量实际场景和真实需求。“从计算、存储到网络,国产化的技术和方案层出不穷。”石静说。

当然,ParaCache并非适用所有场景。石静坦言,短请求、问一次就不再问的场景,KV Cache复用率低,收益不明显。此外,实时交易性非常强的场景,对延迟要求极高,L2到L4无论如何优化也追不上L1 HBM的速度。但她也指出,这两个极端场景在当前的推理应用中不是最多的。“真正需求大的是多轮对话、知识库问答、RAG、AI智能体工作流,这些场景里,公共KV Cache的占比越来越高,ParaCache的价值也越来越大。”石静指出。

存储正在从一个“配角”走向前台。它不是要替代GPU,而是要让GPU的算力花在真正该花的地方,而不是等数据、搬数据。如果一套存储方案能让已有的GPU跑出两三倍的吞吐量,让首包延迟降下来,让并发请求扛得住,那它就不只是一个存储产品,而是推理效率的放大器。(本文首发于钛媒体APP,文|Leo张ToB杂谈,作者|张申宇,编辑丨盖虹达)

本文系作者 Leo张ToB杂谈 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里

敬原创,有钛度,得赞赏

赞赏支持
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

登录后输入评论内容

扫描下载App