近日,深圳国家超级计算中心(NSCC-SZ)开发的新一代百亿亿次级超算系统“灵晟”(LineShine)的具体架构与细节参数正式曝光。据相关论文披露,该系统采用完全基于CPU处理器的独特技术路线,未使用任何GPU加速器,处理器、存储到互联网络均采用中国自主研发技术,峰值性能超过2EFlops。
LineShine系统由20,480个计算节点构成,每个节点搭载2颗基于ARMv9架构的LX2处理器,全系统总计40,960颗处理器,超过245万个CPU核心。节点间通过“灵渠”高速网络互连,采用双平面多轨胖树拓扑结构,每个节点带宽达1.6 Tb/s。每个LX2处理器内集成两个计算芯粒,共304个CPU核心,分为8个集群,每个集群拥有38个核心,配备32 KB的L1指令缓存和32 KB的L1数据缓存,每集群共享28.5 MB的L2缓存。
所有CPU核心支持Arm SVE(可伸缩向量扩展)和SME(可伸缩矩阵扩展),可高效处理FP64、FP32、BF16、FP16、INT8等多种数据格式的AI训练与推理任务。单颗LX2处理器在FP64/FP32精度下分别提供60.3/120.6 TFLOPS算力,在BF16/FP16精度下提供240 TFLOPS算力,在INT8精度下提供960 TOPS算力。
LX2处理器采用混合内存设计,集成8个总计32GB容量的HBM高带宽内存,总带宽达4TB/s,同时支持最高256GB的片外DDR5内存。这种设计避免了传统CPU-GPU异构架构中频繁的数据搬运开销。芯片内置SDMA引擎,负责在HBM和DDR之间智能调度数据,对AI训练负载尤为重要。
整个LineShine系统分布在92个计算机柜中,包含47,000个CPU、100万端口互连、36个网络机柜、67个存储柜、428个存储节点,存储带宽达10 TB/s,总存储容量650 PB。在训练63亿参数的地球观测生成压缩模型时,系统BF16实际性能为1.543 ExaFLOPS,峰值性能可达2.166 ExaFLOPS。
国家超级计算深圳中心主任、“灵晟”系统总设计师卢宇彤表示,“灵晟”是世界首台持续性能超2EFlops FP64的超级计算机,依托国产高性能CPU、片上高带宽内存、高速互连网络等核心技术,实现架构、性能、能耗等六大技术突破,软硬件全栈自主可控。其自研片上多精度混合计算加速框架和面向领域的超智融合软件平台,可统一支撑科学计算、工程计算、智能计算“三算合一”,在分子动力学、流体仿真、生命科学等领域实现国际领先性能。
当前超算系统普遍采用CPU+GPU异构计算架构,但LineShine选择CPU-only路线,避免了异构计算带来的复杂问题,如昂贵的CPU到GPU数据传输、复杂的编程模型和GPU内存限制。此外,该系统结合HBM和大容量DDR能力,拥有更大的连贯内存池,适合处理海量科学数据集和长上下文窗口任务。
在特殊技术封锁背景下,LineShine系统为保障国家战略计算需求、探索自主技术路线提供了关键“备份”与补充,尤其适用于将AI与大规模科学模拟、数据分析深度融合的“AI for Science”场景。深圳市科技创新局有关负责人表示,“灵晟”系统的全面点亮和测试完成是我国高端计算领域全栈自主可控的标志性成果。