为Token加速  中科曙光IBGDA技术国内首次规模落地

2026-09-15 16:18:36 来源: 科技日报 点击数:

科技日报记者 杨雪

近日,中科曙光发布Token加速技术体系。该体系以scaleFabric原生无损RDMA(远程直接内存访问)为核心网络传输底座,构建算—存—传三级紧耦合的Token加速超级通道。其中,支持GPU(图形处理器)直通网络的IBGDA技术实现在国内的首次规模化落地。

Token生成效率直接影响模型的响应速度和服务能力。从模型训练时的梯度同步,到推理阶段KV Cache(缓存机制)跨节点迁移,海量数据需要在多块GPU之间分发汇总,一旦出现CPU调度拖累、存储访问卡顿、网络链路抖动,就会造成GPU空转等待,直接拉低集群算力利用率,推高AI业务运行成本。

“算力”不等于“产出”。如何打通算存传的数据流转堵点,让硬件算力真正转化为模型的实际输出能力,已经成为亟待解决的现实难题。中科曙光scaleFabric Token加速技术体系,正是瞄准这一行业痛点打造的全链路解决方案。

“传统的单卡推理越来越难以支撑大模型的参数量需求,很多时候即使八张卡也难以容纳完整模型,这种情况下,必然需要采用分布式架构,通过多个节点存放一个模型并完成推理。”中科曙光高速网络互联产品部总工程师万伟解释,这意味着模型推理所需的Token相关数据必须在多个节点之间交互。数据流转是并行计算逻辑的一部分,其时延会对MFU(模型算力利用率)和整体效能产生重大影响。包括KV Cache存储优化在内的各种手段,本身也是数据流转效率的一部分。因此,数据流转效率是影响Token生成效率的关键因素。

scaleFabric通过构建“算存传”三级紧耦合的Token加速通道,在网络层面和计算、存储紧密协同,加速Token吞吐效率,实现Token在大模型训练、推理到存储复用全链路的高速流转。

在大规模集群中,多级网络转发的时延成为影响Token流转效率的重要因素。在典型两层组网中,数据从源端到目标端通常需要经过“接入、汇聚、接入”三跳,网络时延也会随转发层级增加而累积。

数据显示,scaleFabric单跳转发时延低至260纳秒,网卡端到端时延低于1微秒,与英伟达NDR持平;在部分场景的三跳基准时延性能测试中,端到端时延较主流RoCE方案降低约63%,有效减少多级网络交换带来的时延累积。较低的三跳时延可以减少数据在多级网络中的传输耗时,使IBGDA和存储直通带来的路径优化进一步延伸至大规模集群,推动计算、存储和网络共同作用于Token生成效率。

当前,MoE已成为模型主流架构。MoE模型通信中,Token分发与合并会产生大量并发小消息,由CPU作为“中介”参与转发调度会带来显著的延迟与CPU开销。IBGDA通过减少CPU参与关键通信路径,大幅提升了MoE专家并行通信效率。

此前,IBGDA的规模化落地始终由国际厂商主导,国产RDMA网卡与GPU直通的落地案例极为罕见。依托scaleFabric原生RDMA无损高速网络,中科曙光自研IBGDA技术已在十万卡级大规模集群中完成验证,实现了这一领域的关键补位。

目前,scaleFabric已经完成与DeepEP等通信框架的适配,进一步完善了scaleFabric面向大模型的软件生态,推动IBGDA融入现有应用环境,加快相关技术走向业务应用。

随着IBGDA进入规模化部署阶段,scaleFabric Token加速技术体系有望进一步提升多卡之间的数据交换效率,为MoE等模型提供新的国产高速互连选择,也为国产智算基础设施通过系统优化提升整体性能提供有力支撑。

责任编辑:孙莹
网友评论
最热评论
没有更多评论了

抱歉,您使用的浏览器版本过低或开启了浏览器兼容模式,这会影响您正常浏览本网页

您可以进行以下操作:

1.将浏览器切换回极速模式

2.点击下面图标升级或更换您的浏览器

3.暂不升级,继续浏览

继续浏览