科技日报记者 崔爽
9月17日,华为全联接大会2026在上海开幕。会上,华为副董事长、轮值董事长汪涛发布全球首个采用NPO(近封装光学)技术的超节点——昇腾960超节点。它可扩展至4096张卡,面向十万亿参数规模大模型训练和推理。
当前,昇腾910C超节点已规模部署超过1000套,昇腾950超节点实现规模化商用。随着大模型参数规模从万亿级向十万亿级甚至更大规模演进,算力基础设施不仅要承载更大规模算力,还需在互联、内存、供电、散热和可靠性等方面满足更高要求。
“华为的核心使命是打造坚实AI算力底座。”汪涛在接受科技日报记者专访时说,“我们走不同的创新路径,利用全新的系统创新架构突破算力瓶颈,满足国产大模型更大规模的训练、推理需求,保证产业能够赶上甚至超越最领先水平。”

发布会现场。受访单位供图
提升模型算力利用率
根据鹏城实验室和全球计算联盟联合发布的《超节点定义与实践白皮书》,超节点是一种在物理上由多个计算节点通过高效的互联协议紧密连接组成,具备跨物理节点的统一内存编址能力,逻辑上具备“一台计算机”特征的计算系统。
“什么叫真正的超节点?必须是超节点内的内存可以统一编址,意味着任何一个AI芯片可以访问超节点内的所有内存共享池,可以统一池化。”汪涛说。
在他看来,超节点与传统集群的差异,核心就在于“怎么连接、怎么协同”。传统集群架构在应对AI大模型“紧耦合、同步并行”的计算特征时,面临通信瓶颈与效率衰减问题。超节点技术构建全局统一内存地址空间、实现内存语义跨节点访问,以及高带宽、低时延互联,将分散的物理计算单元融合为逻辑一体的“超级计算机”,突破算力扩展的架构层面约束。
规模化互联对效率的影响十分显著。华为马尔科夫实验室仿真结果显示,4K超节点组成的10万卡集群相比由8卡服务器组成的10万卡集群MFU(模型算力利用率)提升了2.75倍。“当然在具体模型表现上,这个倍数并非一概而论,但能大致反映整体趋势。”汪涛说。
构建如此大规模的计算系统,需要提升包括芯片、互联、内存、供电、散热、软件等在内的系统工程能力。“只做好一个芯片是远远不够的,只做一个整机、做一台服务器也是不够的,最终需要的是复杂、多学科的系统工程能力,给客户交付一个高可用的计算系统,才能真正创造价值。”汪涛说。
采访中,汪涛也透露了目前“超节点+集群”的能力上限:多个昇腾960超节点可以进一步互联,组成更大规模的算力集群。其中,通过灵衢网络或RoCE(基于融合以太的远程内存直接访问协议)连接,集群规模最大可扩展至51.2万卡;而结合多轨道拓扑技术,最多可支持100万卡昇腾超节点集群。

昇腾960超节点。受访单位供图
构建高速互联体系
单一超节点集群越来越大,如何实现更好互联?昇腾960超节点的答案是以“灵衢+Hi-ONE”构建高速互联体系。
灵衢是华为自主研发的面向超节点的互联协议,旨在解决大规模计算资源连接的互联技术难题。它通过整合多台物理机器的计算资源,在逻辑上形成统一的超节点架构,支持人工智能基础设施的推理与学习。
Hi-ONE则是业内首个NPO光引擎。
随着集群规模扩大和传输速率提升,传统电互联面临信号损耗、高密度布线等挑战。因此,需要把光引到计算芯片的最边上。NPO作为与计算芯片近封装的光引擎,可在计算芯片的边缘几厘米处实现光电转换,突破铜缆在传输距离与带宽上的物理限制,降低大规模互联带来的功耗和时延压力。
“我们将30年积累的光技术用于超节点系统,在昇腾960超节点中使用了业界首个NPO光引擎Hi-ONE,以缩短高速电信号的传输距离,让电信号尽早转换为光信号。”汪涛介绍,Hi-ONE有三个“第一”。它是业界首个具备量产能力的NPO产品,是目前行业传输能力最大的NPO产品,也是唯一实现内置光源的NPO产品。

华为副董事长、轮值董事长汪涛发布昇腾960超节点。受访单位供图
“算力基础设施最终服务的还是模型和应用创新。”汪涛坦言,“我很高兴看到中国涌现出一批十分优秀的大模型企业,既有头部互联网公司,也有大模型初创企业。他们的优异产品和强大的创新能力显著提升了中国人工智能的全球影响力。华为的使命是为这些优秀企业构建坚实的算力底座,做好他们坚强的后盾和伙伴。”
“我们坚持打造强大的AI基础设施,构建开源开放的算力生态,支持主流大模型基于昇腾原生训练,积极拥抱百模千态,迎接智能世界加速到来。”汪涛说。

网友评论