据法新社报道,OpenAI与AMD、博通、英特尔、微软及NVIDIA合作,历时两年开发出一种名为“多路径可靠连线”(Multipath Reliable Connection,MRC)的超级电脑网络协议。该协议已通过开放运算计划(Open Compute Project,OCP)正式开源,供业界使用。
在训练大型语言模型(LLM)时,单一数据传输延迟可能导致整个GPU集群闲置。随着集群规模扩大,网络拥堵和硬件故障的影响愈发难以控制。MRC协议通过三项核心机制解决了这一问题。
首先,该协议将800Gb/s网络接口拆分为多条100Gb/s的小连接,使得两层交换机架构能够连接超过13万颗GPU,从而取代传统3至4层设计。其次,MRC采用封包喷洒技术,将同一传输分散至数百条路径同步进行,大幅缓解核心网络拥堵。最后,协议以IPv6 SRv6静态来源路由取代动态路由协议BGP,能够在微秒内绕过故障路径,省去交换机重新计算路由的时间。
目前,MRC协议已部署在OpenAI现有最大规模的NVIDIA GB200超级计算机集群中,包括甲骨文位于美国德州阿比林的“星门”数据中心及微软的Fairwater超级计算机。同时,该协议已被用于多个ChatGPT与Codex模型的训练。
OpenAI工业算力主管Sachin Katti表示,MRC协议的端对端架构有效避免了训练过程中的网络延迟与中断问题,显著提升了模型训练效率。
此外,NVIDIA透露,MRC最初在Spectrum-X以太网络硬件上完成验证与优化,客户可在MRC与其他RDMA传输协议之间自由选择。