服务器 频道

中科曙光新一代词元加速方案:让存储开始“理解”推理

  8月28日,贵阳,2026中国国际大数据产业博览会开幕。大会期间,中科曙光发布新一代词元加速方案ParaCache。它不是算力芯片,不是大模型本体,而是一个聚焦于KV Cache全层级管理的词元引擎。

  在AI基础设施领域,这不是一个容易引发关注的概念,但ParaCache公布的一组数据却让行业眼前一亮:在120K长文本下,单轮对话首词元时延最高降低98.5%,仅400毫秒;高并发场景词元吞吐量最大提升27倍。

  这组数据背后,暗含着一个清晰的信号:全球大模型的算力消耗重心正从训练全面转向推理,AI基础设施的建设思路,正在经历一场从堆砌GPU到存算协同的结构性转身。

  推理之困:当“健忘症”遇上“天价记忆”

  大模型推理之所以昂贵且缓慢,根源在于其“自回归”的生成方式。每生成一个新词元,模型都需要重新计算此前全部历史内容的键和值向量,这种平方级的计算增长,使得处理长文本时如同身陷泥沼。

  用更通俗的话说,大模型在每一轮回答中都像是患上了“健忘症”,明明上一轮刚看过整篇文档,下一轮却要重新逐字逐句再读一遍。为解决这种算力浪费,业界引入了KV Cache加速技术,将已计算出的键值向量暂存于GPU的高带宽显存(HBM)中,以记忆换算力。

  然而,这带来了新的窘境。HBM容量有限且价格高昂,随着模型参数从千亿迈向万亿、上下文窗口从16K向百万级词元演进,KV Cache对显存的消耗急剧膨胀,业内称之为“显存墙”。

  更关键的是,传统KV Cache往往局限于单节点、单对话内的复用,它在单个会话中确实消除了重复计算,但一旦切换到跨对话、跨节点的大集群推理场景,加速效用便迅速衰减。相同的一份知识库文档、同一组标准提示词,在成百上千个并发请求中被反复计算,GPU算力在低效的重复劳动中被大量吞噬。

  这构成了当前大模型推理落地面临的双重困境:推理越来越慢,记忆越来越贵。而这两种挑战的叠加,直接导致企业在落地大模型业务时陷入两难:要么花费高昂成本堆砌高端GPU和超大容量显存,要么忍受性能抖动和排队延迟,业务承载能力始终上不去。

  解构ParaCache:将“用完即弃”变为“数据资产”

  中科曙光ParaCache方案的核心逻辑,在于重新定义了KV Cache的生命周期和角色定位。

  中科曙光分布式存储产品部总经理石静表示,传统架构中,KV Cache被视为推理过程中的临时状态,用完即弃;而在ParaCache的视角下,KV Cache应当成为一种数据资产,可以被反复调用、跨请求共享、跨节点流动。

  为实现这一转变,ParaCache构建了一套四层级联动的全层级缓存管理体系:

  L1层(GPU HBM):存放高频访问的热词元,确保极致访问速度;

  L2层(CPU DRAM):容纳温数据,作为HBM与下层存储之间的缓冲;

  L3层(本地SSD与集中式存储FlashNexus):中科曙光首次将集中式FlashNexus存储纳入该层级,通过池化方式为多个计算节点提供统一的KV Cache访问,实测显示其在延迟、吞吐量和多请求并发数上相较于本地SSD均有约2倍的提升;

  L4层(分布式共享存储池,基于ParaStor):作为冷数据仓库,直接通过高效的POSIX协议和AI直通存储技术参与KV Cache的调度、卸载与回迁,使分布式存储不再仅仅是冷数据的墓地,而是推理链路中的主动参与者。

  这套架构的关键突破在于全局视图下的智能调度。ParaCache通过构建统一的元数据管理体系,打破了传统方案中各层级元数据相互独立、难以协同的元数据迷雾。

  基于这一全局视角,系统能够根据KV的热度、容量水位和业务策略,自动决策数据应在何时从L4回迁至L1,或从L1卸载至更低成本的存储介质。

  更值得关注的是,ParaCache支持基于目录级别的差异化淘汰策略,不同的推理应用可以设置不同的KV Cache保留时长和淘汰规则,实现真正的按需调度。

  此外,在L4层级,ParaCache针对分布式存储传统上延迟较高的痛点做了多项定向优化:将覆盖写改为追加写以降低延迟、对分布式锁进行轻量化改造以消除性能瓶颈、在PD分离架构中仅传输增量KV以节省网络带宽。

  这些看似底层的工作,恰恰是让分布式存储真正进入推理生产环境的关键所在。

  性能与成本的再平衡:不止于“存”与“算”

  ParaCache带来的性能收益,远不止于首词元时延的降低。在吞吐量层面,通过跨GPU构建分布式共享KV缓存池,系统实现了“一次计算、多次复用”。这意味着,当大量用户同时询问基于同一份知识库文档的问题时,推理集群只需计算一次文档的KV张量,后续请求直接命中缓存结果,GPU算力被释放出来处理差异化内容。

  在曙光8000十万卡集群的验证中,这一机制在长上下文对话、高并发推理服务、AI智能体工作流和高通量推理四类场景中均经受住了生产级考验。

  在成本层面,ParaCache的价值体现为对硬件配置的减负。由于系统能够将冷数据下沉至SSD乃至分布式存储,企业无需再为维持推理速度而被迫配置超大容量的HBM或高频内存。

  石静表示,在长上下文、多轮对话、RAG知识库等典型场景下,该方案可帮助企业在内存或SSD配置上节省约三分之一的硬件采购成本,用中低配硬件的成本跑出高配硬件的上下文长度,集群总体拥有成本得到显著优化。

  更值得注意的是,传统观点往往认为,KV Cache下沉至SSD或分布式存储必然带来性能妥协。但ParaCache的实测数据表明,通过智能预取和预加载机制,系统在推理框架发出数据请求之前,便能基于KV语义提前感知需求并将数据从L3或L4提升至更高层级,实际推理性能并未出现明显衰减,甚至在缓存容量下调后仍能保持稳定,这打破了性能与容量不可兼得的固有认知。

  生态站位:原生兼容与全国产化的双重锚点

  ParaCache在生态策略上展现出了务实且清晰的判断。一方面,它原生兼容LMCache,当前全球KV缓存管理领域的事实标准。这意味着,大量基于vLLM、SGLang等主流推理框架部署的生产业务,无需重构技术栈即可平滑接入,大幅降低了客户的迁移成本和改造风险,保护了现有开源技术投入。

  另一方面,ParaCache的部署验证已覆盖国产算力生态。在曙光8000十万卡集群上,ParaCache依托自研的scaleFabric原声RDMA无损高速网络和ParaStor分布式全闪存存储,成功实现了跨节点、跨GPU的KV张量全局共享。

  笔者观察:从“数据容器”到“推理参与者”

  ParaCache的发布,折射出中科曙光存储业务的一次重要身份跃迁,从传统的“数据存放容器”进化为“推理链条上的主动参与者”。

  在词元经济时代,推理成本直接决定了AI应用规模化落地的边界。ParaCache通过精细化的全层级缓存管理,让昂贵的GPU显存从单次性消耗品变为可共享、可调度的全局资源池,其本质是用更理性的存力去释放被大量浪费的算力。

  在大模型推理从“能用”走向“好用”、从单卡走向十万卡集群的进程中,算力与存力的边界正在被重新定义。

  存储不再是被动响应IO指令的配角,而是决定哪些记忆留在显存、哪些下沉到内存与SSD、何时预取、何时淘汰的决策主体。这一转变,或许正是AI驱动下数据基础设施最深层的结构性变化。

0
相关文章