据DIGITIMES报道,NVIDIA超大规模与高效能运算(HPC)副总裁Ian Buck在2025年OCP全球高峰会上发表主题演讲,探讨AI开放式基础设施的未来。他详细阐述了NVIDIA在AI基础设施领域的扩展角色及其对OCP生态系统的技术贡献。
Buck表示,NVIDIA已从芯片设计公司转型为全端基础设施供应商,涵盖系统、数据中心与超级计算机。他将当前阶段称为“AI的Gigascale时代”,其特点是运算、网络、机构工程与电力系统的复杂度急剧上升。现代AI数据中心被形容为增值资产,因其效能与价值随时间持续提升。
在演讲中,Buck举例说明采用与OCP标准对齐的NVIDIA基础设施可显著提升效能。例如,在使用B200架构的数据中心中,OpenAI的GPT-OSS模型效能于2个月内提升5倍,每百万token的输出成本从0.11美元降至0.02美元。在推论工作负载方面,采用GB200与NVL72架构的系统在测试中效能比基于H200 GPU的系统高出15倍。
AI模型的设计变得越来越复杂。早期的稠密模型如Llama 3大约使用1万个核心,而现今的混合专家架构如DeepSeek R1与GPT-OSS可能多达1,000万个核心。业界对上下文长度的关注不断上升,这对内容生成与程序助理等高价值应用至关重要。NVIDIA预计,需处理约100万token上下文窗口的应用将在未来10年推动市场主要成长。
Buck还介绍了NVIDIA的下一代架构Verment,预计于2026年下半发布。此系统将完全兼容OCP基础设施,并结合两款新处理器,包括专为AI运算设计的Rubin GPU和专为上下文处理优化的CPX处理器。Verment架构预计可提供超过8 exaflops的推论效能,约为现有平台的7.5倍,并支持400G网络带宽。
NVIDIA计划向OCP NGX平台贡献多项技术,包括全液冷、兼容OCP的托盘设计,支持45°C进水温度,可重用现有冷却系统。此外,还包括机架与电力创新、NVLink Fusion等技术。Spectrum-X以太网技术正快速被AI数据中心采纳,Meta、微软和甲骨文等公司均已采用该技术。
展望2027年底,NVIDIA的Kyber设计目标是在单一机架中整合576颗GPU。为支持此规模,公司正参与Mount Diablo计划,推动800伏特直流基础设施,已有多家合作伙伴计划依此标准建构数据中心。Buck最后邀请与会者参观NVIDIA的NGX生态系统展示区,呈现支撑公司下一代AI系统的核心元件与架构。