服务器 频道

从“容器”到“引擎”:看中科曙光IO500双榜第一的背后

  2026年6月,德国汉堡,ISC高性能计算大会。

  当全球科技的聚光灯习惯性地追逐着最新的GPU算力芯片时,一份新鲜出炉的IO500榜单却正在传递出一个更具深意的信号:中科曙光ParaStor F9000全闪存储系统,在生产型全节点与10节点两大榜单中同时登顶,成为首个达成此项成就的中国厂商。

  在AI产业算力焦虑的今天,这看似只是国产硬件的又一次刷榜。但如果我们只把目光停留在第一的排名上,很可能会错过一个关键转折:在万卡乃至十万卡集群时代,算力的天花板往往不在芯片上,而在数据能否及时、稳定地喂到芯片嘴边。

  双榜第一的含金量:一场“实战”而非“演习”

  要理解这次登顶的意义,首先要厘清IO500榜单的一个关键划分。它分为“研究型”和“生产型”,后者堪称残酷。

  据中科曙光北京公司总裁助理、分布式存储产品部总经理石静介绍,研究型榜单允许使用实验室环境下的极端配置,甚至可以不考虑数据冗余,只为摸到性能天花板。而生产型榜单要求参测系统必须在真实生产环境中稳定运行超过一年,承载着实际业务负载,冗余设计与持续运行能力缺一不可。

  这好比一个是不计成本的概念车,一个是经受住市场考验的量产车。ParaStor F9000登顶的是后者,意味着它不是在真空环境下的一次性爆发,而是在重压之下持续输出高能。

  据了解,这套系统已在国家超算互联网核心节点的数万卡集群中稳定运行超过一年,支撑了百余个AI与高性能计算生产应用。

  破局算力空转:存储要从“容器”变“引擎”

  长久以来,产业界有一种重算力、轻存力的惯性思维,认为存储只是数据的仓库。但在大模型动辄万亿参数、训练数据以PB级增长的今天,这种认知正付出沉重代价。

  沟通中,中科曙光分布式存储总工程师袁清波一语道破痛点:“AI训练不是一成不变的训练,它需要时时刻刻的数据,并且这个数据是完全随机的,一旦数据没供到位,卡就停了。你要是多少万卡停了,每秒都是钱在燃烧。”

  更有行业研究指出,在大规模分布式训练中,网络与存储I/O瓶颈导致的GPU空闲等待相当普遍,这意味着高价购置的算力资源,在相当比例的时间里处于等饭吃的空转状态。

  这正是ParaStor F9000此次夺冠的产业价值所在。它试图解决的,已不是简单的存数据,而是如何让数据追上算力。

  全栈自研的“超级隧道”:从硬件到协议的协同

  那么,ParaStor F9000是如何拿下双榜第一的?具体来看,关键在于其存算网强协同的系统工程思维。

  首先是硬件层面的“量身定制”。与传统存储厂商直接采用标准服务器不同,曙光为F9000独创了“2U2N”的双子星架构。在2U空间内集成两个独立物理节点,让CPU直连NVMe SSD与网卡,摒弃了PCIe Switch带来的额外延迟。

  袁清波解释指出,这一设计提供了两倍的PCIe Lane数量,为后续极致的性能调优打下了物质基础。

  其次是软件层面的“全域调度”。在硬件红利之上,曙光研发了“超级隧道”技术。这套技术将每一次IO请求从计算节点网卡、到存储节点CPU、再到后端SSD盘的路径都做了“排布”。

  袁清波提到,我们能做到“用户的每一次IO,从发出那一刻起,我们就知道它要走哪个网卡、用哪个内存、下到哪个盘”,甚至将内存带宽跑到了峰值状态。

  第三是网络层面的“第三条路”。在高速互联上,曙光并未完全依赖市面通用的InfiniBand或RoCE,而是拿出了自研的scaleFabric 400G无损网络。

  中科曙光高速网络互联产品部总工程师万伟表示,IB虽好但受制于单一供应商且扩展规模有限;RoCE则在超大规模集群下存在性能妥协。scaleFabric不仅兼容IB生态,还将网络支持规模从IB的48k提升到了110k节点,解决了万卡集群的网络扩展瓶颈。

  去“搬运工”化:存储正在吃掉计算的部分工作

  本次榜单最值得关注的一个技术风向,是ParaStor F9000提出的“AI存储三级协同方案”,其目标非常明确:“以存提算、以存代算、以存降本”。

  传统架构中,存储只负责搬运数据,数据的预处理、清洗、转换全由昂贵的GPU或CPU承担。而ParaStor F9000的做法是,在存储节点内置轻量化AI算子加速库,将数据清洗、样本分片、向量编码等预处理任务下沉到存储端执行。

  这直接带来的好处是:跨节点数据传输量减少70%,将昂贵的GPU算力从繁琐的搬运工与预处理工作中解放出来。

  此外,面对大模型推理中困扰业界的显存墙问题,ParaStor F9000集成了KV Cache offload引擎。它能自动将GPU中闲置的KV缓存块卸载到后端高性能全闪存储,在推理时再通过高速通路回传。

  据实测数据显示,这能降低60%以上的GPU显存占用,单卡并发推理承载量提升2至10倍。这相当于用存力间接换取了宝贵的算力资源。

  写在最后

  中科曙光ParaStor F9000登顶IO500,它标志着在AI基础设施的竞赛中,中国的技术路线已经从单点硬件突破,转向了计算、存储、网络深度捆绑的系统级协同创新。

  当存力成为AI下一阶段发展的最短木板,谁能让数据流淌得更快、更稳、更智能,谁就掌握了降低大模型落地成本、提升集群有效算力的密钥。

  ParaStor F9000的夺冠,证明了国产存储不仅能在实验室跑出高分,更能在万卡实战的硝烟中,扛起数据主动脉的重任。它让产业界看到,算得快固然重要,但存得住、读得稳、流得顺同样决定着一个国家AI底座能走多远。

0
相关文章