据The Information报道,NVIDIA与其主要客户OpenAI、Meta和微软等科技巨头经过一年的技术调整,成功克服了新一代Blackwell AI芯片在部署初期的复杂挑战,现已进入规模化应用阶段。
Blackwell芯片的部署初期面临诸多技术难题,特别是NVL72服务器机柜的设计问题。该机柜连接72颗Grace Blackwell芯片,旨在提升超大型AI模型的训练效率。然而,芯片的紧密连接带来了过热与连接问题,单一芯片故障可能导致整个系统瘫痪,迫使企业重新启动训练,耗费巨大成本。2024年夏天,这些问题导致部分云端服务商削减订单或转向采购旧款芯片。
为解决这些问题,NVIDIA推出了改良版Grace Blackwell芯片“GB300”。据知情人士透露,新版本具备更佳的冷却能力、更高品质的材料与连接器,显著降低了系统连接难度。Meta的工程师表示,新版系统运行更加顺畅,而OpenAI也调整了订单,将未到货的配额转为采购GB300芯片。
Blackwell芯片的延迟部署对云端供应商(CSP)造成了财务压力。供应商需先支付硬件成本,待客户使用后才能获得收入,因此部署延迟直接影响利润。一份内部文件显示,甲骨文在截至2025年8月的3个月内,因Blackwell芯片租赁业务损失近1亿美元,主要原因是OpenAI位于德州Abilene的数据中心在硬件测试与验收期间出现延迟,导致营收空窗期。为此,NVIDIA向部分客户提供退款或折扣以弥补损失。
尽管过程曲折,NVIDIA已解决大部分技术障碍。OpenAI于2月5日表示,最新AI模型GPT-5.3-Codex正是利用这些系统共同设计、训练与服务。此外,Tesla CEO Elon Musk旗下的xAI在部署上领先对手,2025年10月已在xAI曼菲斯数据中心运行约10万颗GB300芯片。
面对挑战,NVIDIA的市场地位依然稳固,市值维持在4.24万亿美元。部分NVIDIA员工认为,在OpenAI和Meta规划的巨大规模下,要求芯片表现完美是不切实际的,这也反映了NVIDIA CEO黄仁勋挑战技术极限的策略。