服务器 频道

从Atlas 950 SuperPoD真机首秀,看WAIC 2026释放的信号

  前不久,2026世界人工智能大会,一台由16个计算柜构成的庞大设备成为全场焦点——昇腾950超节点(Atlas 950 SuperPoD)真机首次公开亮相。

  从MWC 2026的海外发布到WAIC 2026的真机落地,华为用半年时间完成了从发布到可触摸的跨越。而更深层的信号在于:华为算力战略正在经历一场根本性转变,从单卡性能竞赛走向系统级集群重构。

  “把8192张卡捏成一台电脑”

  站在Atlas 950 SuperPoD面前,最直观的感受是它不像传统服务器堆叠。机柜内部并非由独立服务器组成,而是由一个个NPU计算刀片和CPU计算刀片构成,16块CPU、64块NPU被集成在一个机柜内,通过正交架构实现无背板直连。

  这背后是一套全新的算力组织逻辑。传统集群依赖Scale-out横向扩展,服务器之间通过以太网互联,规模越大,通信瓶颈越严重。Meta训练Llama3.1时,1.6万卡集群在54天内中断419次,平均每天近8次故障,正是这种架构的天花板。

  华为的选择是Scale-up:用高速互联协议将分散的计算单元“压”进一个低延迟、高带宽的域内,让它们在逻辑上像一台计算机那样协同工作。

  Atlas 950 SuperPoD交出的成绩单是:基于自研灵衢互联协议,单柜64卡为基本单元,现场展示1024卡集群,最大可扩展至8192张NPU卡高速互联。提供1EFLOPSFP8、2EFLOPSFP4算力,配备256TB全局统一内存编址空间,TB级互联带宽配合3微秒超低RTT时延。

  两条路线,一种压力

  超节点并非华为独创。英伟达的GB200 NVL72同样是超节点思路,但单柜规模停留在72张GPU。问题不在GPU,而在互联,NVLink电互联技术存在距离问题,传输距离超过约1米,损耗和稳定性就会恶化。

  华为走了一条不同的技术路径:机柜内部用电互联,机柜之间用光互联。灵衢机柜内部搭载OCS全光交换机,通过光纤完成机柜间的高速连接,突破了电互联的距离限制。

  这背后是一个现实而迫切的产业逻辑:国产AI芯片在单点性能上与国际领先水平仍有差距。论单芯片性能,国产芯片与英伟达的差距,部分指标可能是八到十年。

  既然单颗芯片“打不过”,就用系统工程能力“补回来”。超节点战略的本质,是用系统级创新对冲单点性能的不足。华为的核心战略就是“超节点+集群”,只有依靠超节点和集群,才能突破中国的芯片制造工艺限制,为中国的AI发展提供源源不断的算力支持。

  从“实验室”到“规模化”

  如果说Atlas 950 SuperPoD代表未来的算力形态,那它也需要证明自己能用起来。华为在WAIC上披露的另一组数据更具说服力:上一代昇腾384超节点已商用落地750多套,规模应用于互联网、运营商、金融、教育、医疗、交通、制造等20多个行业,是国内能独立训练出SOTA大模型的国产算力超节点。

  华为还展示了Atlas 850E风冷超节点,不需要液冷机房改造,标准机柜可直接上架部署,支持96卡商用扩展,可将超节点能力下沉到存量风冷机房。

  在软件生态层面,昇腾2025年底已完成CANN异构计算架构全面开源、Mind系列基础软件全量开源。截至目前,CANN开源社区上线67个项目,开源代码超1244万行,月活跃开发者突破3500人。昇腾已携手3000多家合作伙伴,孵化7000多套行业解决方案,服务2000多家政企核心客户。

  WAIC现场展出的20多个行业标杆案例、60多种真实业务场景,是对“规模化商用”最直观的注脚。

  算力竞争进入“系统级”时代

  超节点在WAIC 2026的集体爆发,华为、中兴通讯、壁仞科技、天数智芯等厂商纷纷展出超节点方案,揭示了一个明确的产业趋势。

  算力竞争的焦点已经位移:不再只是谁的芯片更强,而是谁能让成千上万张芯片像一台机器那样高效工作。当模型参数从千亿迈向万亿,当Agent应用要求百万级上下文,单卡性能的边际收益递减,系统效率成为真正的决定因素。

  华为用Atlas 950 SuperPoD的真机首秀回答了这个问题:算力的未来不是单点的极致,而是系统的合力。从单卡到超节点,从电互联到光互联,从硬件到开源生态,华为正在构建的是一套完整的系统级算力基础设施范式。

  这或许才是WAIC 2026上释放的最核心信号:算力战争已经进入下半场,而游戏规则正在被重写。

0
相关文章