算力不等于产出:中科曙光用Token效率重新定义AI工厂
大模型竞争进入深水区之后,衡量AI系统实力的标尺,正在从单纯的算力规模转向Token效率。
过去几年,行业习惯于用GPU数量、集群规模、峰值算力来定义一座AI工厂的先进程度。但当大模型真正进入规模化训练与推理阶段,才发现堆砌起来的算力,并不必然转化为等比例的模型输出。
GPU空转等待、CPU调度拖累、存储访问卡顿、网络链路抖动,任何一个环节的瓶颈,都会让昂贵的加速卡陷入有力使不出的困境。
基于此背景,中科曙光scaleFabric Token加速技术体系正式发布。该体系以原生无损RDMA为网络传输底座,构建算-存-传三级紧耦合的Token加速超级通道。其中,支持GPU直通网络的IBGDA技术实现在国内的首次规模化落地。
Token的三段旅程:为什么数据流转成了最大瓶颈
要理解这套技术体系的价值,必须先理解Token在AI集群中经历的三段旅程。
第一段:训练阶段——生成模型权重。GPU集群通过All-Reduce等集合通信模式完成梯度同步,海量Token数据在节点间高频流动。训练中的通信是同步操作,一块GPU或一张计算卡稍慢,其他计算卡都要等待。
中科曙光高速网络互联产品部总工程师万伟表示,训练中的通信是同步操作,与过去云计算中的异步操作不同,任何异常时延的增加,都可能降低MFU,也就是模型计算利用率。
第二段:推理阶段——将权重转化为Token。进入推理阶段,模型需要经历Prefill、Decode等过程。在PD分离等架构下,KV Cache需要在Prefill与Decode节点之间传递,甚至需要在GPU、网络和远端存储之间流转。
长上下文场景中,KV Cache体积可达数十GB,其跨节点搬运效率直接决定TTFT(首Token时延)和TPOT(每个输出Token的生成时延)。
第三段:存储阶段——Token的持久化与复用。Token、KV Cache、中间状态以及训练数据,需要在计算与存储之间持续读写,并进一步被AI Agent、RAG等应用复用。存储访问延迟过高会拖慢推理响应,Token复用效率低下则浪费算力。
万伟表示,现在行业出现了以存代算的趋势。中间已经生成的数据,也就是KV Cache,可以暂时保存下来,供后续复用。存储因此也成为当前AI Factory中非常重要的系统。这意味着,存储不再是AI集群的后勤部门,而是直接参与Token生成效率的核心环节。
三段旅程,每一段都需要网络的极致配合。而现实是,网络通信耗时在万卡级分布式训练中已占整体任务时间的30%至50%。数据流转效率,已经成为制约AI集群性能的主要瓶颈。
IBGDA:从“数据面绕过CPU”到“控制面也绕过CPU”
在scaleFabric Token加速技术体系中,IBGDA(InfiniBand GPUDirect Async)的规模化落地无疑是最具标志性意义的突破。
要理解IBGDA的价值,需要先理解它的前身GDR(GPUDirect RDMA)。GDR的核心在于,它允许InfiniBand网卡直接读取或写入GPU显存,完全绕过主机CPU和系统内存。在传统通信路径中,数据需要从GPU显存拷贝到CPU内存,再由CPU通过网卡发出,接收端则是相反的过程。GDR消除了这个中间步骤,极大降低了通信延迟并减少了CPU开销。
但GDR只优化了“数据面”。万伟解释道:即使采用GDR,虽然数据面绕过了CPU内存,但通信任务的下发和相关元数据处理仍然需要CPU参与,RDMA通信可以分为控制面和数据面,传统GDR主要优化了数据面。
这意味着,IBGDA让GPU内核直接在显存中准备好数据并写入工作队列,然后直接向网卡的门铃寄存器发起写入操作以通知网卡。网卡随后通过GDR技术从GPU显存中读取工作描述符和数据,完成后续的RDMA发送。整个过程从数据搬运到任务下发,全部在GPU上完成。
这一技术路径的价值,在MoE架构成为大模型主流的当下被急剧放大。MoE模型通信中,Token分发与合并会产生大量并发小消息,由CPU作为“中介”参与转发调度会带来显著的延迟与CPU开销。
此前,IBGDA的规模化落地始终由国际厂商主导,国产RDMA网卡与GPU直通的落地案例极为罕见。依托scaleFabric原生RDMA无损高速网络,中科曙光自研IBGDA技术已在十万卡级大规模集群中完成验证,实现了这一领域的关键补位。目前,scaleFabric已经完成与DeepEP等通信框架的适配,进一步完善了面向大模型的软件生态。
存储直通:三条技术路径的协同作战
如果说IBGDA解决的是“算”与“传”之间的瓶颈,那么scaleFabric的存储加速通道则瞄准了“存”与“算”之间的数据流转堵点。
scaleFabric围绕Token的存储访问瓶颈,构建了完整的存储直通技术体系——NVMe over RDMA、XDS(XPU Direct Storage)与NFS over RDMA三项技术,打造存储与算力之间的高速通道。
NVMe over RDMA主要面向KV Cache等需要大量缓存的场景。利用scaleFabric的低时延、无损RDMA网络,计算节点能够高速访问远端NVMe存储如同访问本地硬盘,存储访问延迟降低80%以上。
XDS则允许XPU绕过CPU和系统内存,通过RDMA网络直接访问远端存储设备。数据从存储节点经RDMA网卡直接写入XPU显存,全程零拷贝、无需CPU介入,大幅缩短存储访问延迟和XPU数据等待时间。
万伟表示,训练数据的顺序加载以及Checkpoint读写,传统上属于面向文件的数据访问,通常可以使用NFS over RDMA。对于其中的热点数据,目前比较前沿的方式是采用Burst Buffer或NVMe高速闪存。
此时,NVMe over RDMA可以在热数据缓存场景中进一步提升存储性能。在这一过程中,KV Cache卸载和相关数据读写还可以通过XDS,让GPU直接访问远端数据。三项技术是紧密耦合、协同工作的关系。
未来挑战与演进方向
在沟通中,万伟也坦诚谈及未来仍需应对网络整体稳定性方面的挑战。性能与全局稳定性需要兼顾,包括长尾时延和故障恢复等问题。集群规模扩大以后,局部抖动可能在通信过程中被放大,这些都是面临的技术挑战。
面向未来,scaleFabric的演进方向已经明确。万伟透露,下一代将推出800G网络产品和网卡,同时支持更高的交换容量,从而在组网时实现更好的性价比。技术方面还会支持多平面、包喷洒和乱序重组等能力,进一步提高网络通信性能。
在生态建设方面,万伟强调,生态建设最重要的一点,是紧跟整个生态的需求,及时满足AI发展对底层基础设施的要求。今天是IBGDA,下一代还会出现新的技术。我们有信心也有能力及时完成应用和适配。
笔者观察:Token效率时代的系统竞争
中科曙光此次发布的Token加速技术体系,给行业带来的最大启示或许在于:AI基础设施的竞争,正在从单点技术的比拼,转向系统级效率的较量。
当大模型参数规模持续膨胀、MoE架构成为主流、PD分离推理广泛部署、以存代算趋势加速,Token生成效率越来越取决于算力、网络和存储之间的数据流转效率。任何单一环节的优化,都无法独立支撑起AI工厂的高效运转。只有将计算、存储、网络三者紧密耦合,构建端到端的Token加速通道,才能让昂贵的加速卡真正转化为模型的实际输出能力。
当Token效率成为衡量AI系统实力的新标尺,那些能够在算存传三级通道上实现紧耦合加速的基础设施,将在下一阶段的竞争中占据先机。中科曙光已经迈出了关键一步,而这场围绕Token效率的系统级竞赛,才刚刚开始。