中科曙光发布首款自研400G RDMA高速网络架构
来源:龙灵发布时间:2026-03-161122浏览
询问 AI据媒体报道,服务器厂商中科曙光近日推出首款自主研发的400G原生RDMA高速网络架构scaleFabric。该架构从底层112G SerDes IP、交换芯片、网卡设备到管理软件均实现本土自主研发,主要面向AI超大规模算力集群的高速互连需求。
随着AI大模型训练与推理规模的快速扩展,万卡级甚至十万卡级的算力集群逐渐成为主流。然而,在大规模分布式训练环境中,网络通信时间占整体训练流程的30%~50%,这使得高速低延迟网络成为提升AI算力效率的关键基础设施。
目前,全球高性能计算与AI集群互连主要采用由NVIDIA主导的InfiniBand网络架构。该架构凭借低延迟和无损传输特性,在超级计算机和大型AI数据中心中占据主导地位。根据TOP500统计,约60%的高性能计算系统采用InfiniBand互连技术。
然而,服务器厂商在SerDes IP、高速交换芯片、网卡与交换设备等领域长期依赖海外供应商。在此背景下,中科曙光推出scaleFabric RDMA高速网络,旨在构建完整的自主AI互连架构。
scaleFabric主打原生无损RDMA(远程直接内存访问)设计,支持高带宽、低延迟和高可靠性传输,可作为大型数据中心集群的核心互连基础。其400系列网卡采用PCIe 5.0接口,单端口带宽达400Gbps,端到端通信延迟低至0.9微秒;交换机则提供单端口最高800Gbps带宽,整机交换容量达64Tbps,交换延迟约260纳秒,并支持400G×80或800G×40端口配置。
中科曙光表示,scaleFabric的部分性能指标对标NVIDIA的NDR InfiniBand架构,并在规格上进行了优化。例如,交换机端口密度提升约25%,网卡最大QP数量提升100%,单子网可支持11.4万张GPU卡,整体网络部署成本降低约30%。
在稳定性方面,scaleFabric采用基于信用机制的无损流控设计,降低拥塞导致的丢包风险,同时链路故障恢复时间低于1毫秒。目前,该系统已在郑州国家级超算中心完成长时间运行验证,支持三套scaleX万卡级算力集群运行,整体规模约3万张GPU卡,正在进行AI训练与并行计算测试。
业内人士指出,中科曙光此次推出原生RDMA架构,标志着国内在AI智算互连领域逐步建立自主技术路径,减少对海外高速网络技术的依赖。值得注意的是,scaleFabric的推出被视为中国尝试挑战现有AI高速互连生态的重要一步。
自NVIDIA在2020年收购Mellanox Technologies后,其从GPU、网卡、交换机到整体AI集群互连架构,逐渐形成高度整合的“GPU+InfiniBand”算力平台,成为当前大型AI数据中心的主流方案。
若相关技术与产业生态逐步成熟,未来在中国大型智算中心建设中,可能形成与NVIDIA InfiniBand方案并行的另一种技术路线,进一步影响全球AI算力基础设施的竞争格局。
此外,中科曙光此次推出的scaleFabric,不仅在于RDMA架构本身,更在于其宣称完成了从112G SerDes IP、交换芯片到整体网络设备的自主设计。对于高速数据中心网络而言,SerDes与交换ASIC才是最核心的技术门槛。
目前,在400G与800G数据中心网络市场,高速SerDes与交换芯片主要由少数国际供应商主导,包括NVIDIA、Broadcom及Marvell等。若中国厂商能在112G SerDes与高端交换芯片上逐步建立自主技术能力,将意味着其AI算力基础设施不仅局限于服务器与GPU层面,而是开始向数据中心网络核心技术延伸,长期可能重塑全球AI算力供应链的竞争版图。
新闻来源:龙灵,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
