中科曙光近日宣布推出scaleFabric Token加速技术体系,该体系以原生无损RDMA高速网络为核心,通过计算、存储与网络的深度协同,显著提升大模型运行效率。这一创新成果标志着国内AI基础设施在全链路数据流转效率领域取得重要突破,尤其在十万卡级集群中实现规模化应用。
在分布式AI架构中,Token作为模型处理和输出的基本单元,其生成效率直接决定系统响应速度。中科曙光高性能计算产品事业部总工程师万伟指出,Token数据需在不同GPU间频繁传递,数据流转效率已成为制约集群计算性能的关键因素。训练阶段需同步梯度数据,任何单卡延迟都会导致整体计算利用率下降;推理阶段则涉及大量缓存数据搬运,用户感知的"首字延迟"和"输出速度"均与数据传输速率密切相关。
随着MoE架构的普及,模型运行产生的高频并发小消息通信对传统网络构成严峻挑战。研究显示,在大规模训练中,网络通信耗时占比已达30%-50%,传统路径的CPU开销更成为性能瓶颈。这种背景下,AI产业竞争已从单卡算力比拼转向全链路效率优化,算力、网络、存储的协同能力成为系统性能上限的决定性因素。
针对行业痛点,中科曙光研发的InfiniBand GPUDirect Async(IBGDA)技术实现重要突破。该技术允许GPU直接控制网卡通信,绕过CPU中转环节,使小消息通信延迟降低60%以上。在MoE模型场景中,这项创新相当于为数据传输开辟专用通道,经多场景测试显示,结合全链路优化后系统整体性能提升20%-30%。
存储环节的协同优化同样关键。当前行业正构建多层次存储加速方案,针对模型加载、缓存读写等不同场景,通过减少数据搬运环节提升计算单元访问效率。这些技术共同构建起存算网协同的技术底座,使系统资源利用更加高效。
在算力生态建设方面,中科曙光采用开放架构策略。北京公司scaleFabric产品经理纵瑞博表示,该体系已实现与多家国产厂商产品的适配优化,在RoCE和NVIDIA InfiniBand之外,提供高性价比的国产原生无损RDMA网络方案。这种自主可控的底层网络技术,为国产算力生态协同发展奠定坚实基础。
目前,基于scaleFabric的自研IBGDA技术已在超大规模集群中完成验证,其性能表现达到国际先进水平。这项突破不仅弥补了国产单卡性能差距,更通过系统级创新开辟出提升集群效能的新路径,为国内AI基础设施发展提供重要技术支撑。




