据《华尔街日报》(WSJ)近日报道,NVIDIA计划在2026年GTC大会上发布一款整合Groq语言处理单元(LPU)技术的全新推理芯片。OpenAI已同意成为该处理器的最大客户之一,并将向NVIDIA采购大规模“专用推理产能”。这一动向表明,AI巨头正从训练算力的军备竞赛,转向推理算力的多线布局。
AI产业过去处于疯狂堆砌参数的“训练军备竞赛”阶段,如今转向模型落地、AI代理(AI Agent)普及的“应用角力”。客户关心的核心指标,从“能否训练出最强大模型”,急转为每个Token的推理成本多少。
花旗研究报告指出,AI算力的极致追求正推动PCB产业从“数量竞争”转向“价值跃升”。NVIDIA即将在GTC大会发布的LPU机架,有望成为点燃高端PCB赛道的关键。
NVIDIA看似坚固的护城河,正面临来自市场、客户与技术的“三重围剿”。首先是客户对“极致性价比”的追求。OpenAI在承诺成为NVIDIA新芯片最大客户之一的同时,已与Cerebras达成数十亿美元合作,并大规模使用亚马逊(Amazon)自研Trainium芯片。Meta则向NVIDIA下单后,随即宣布向超微(AMD)采购高达6 GW的算力订单,且CPU也是Meta部署重点。
第二个围剿来自客户自研芯片的“垂直整合”雄心。Google TPU已从内部工具成长为对外服务的核心算力,最新Gemini模型完全基于TPU训练。亚马逊Trainium芯片则绑定其AWS云端服务,这些科技巨头自研芯片的逻辑,更着眼于构建排他性优势。
第三个围剿来自于GPU架构在推理场景的包袱。GPU系为大规模平行运算而生,为训练时代的绝对王者,但在大型语言模型推理,尤其耗时最长的“解码”(Decode)阶段,其架构并非最优解,有着延迟高、能效比相对不足的问题。相对地,LPU专为语言模型推理优化,采用不同的存储器与运算架构,透过极简指令集、大规模SRAM整合,甚至可能采用3D堆叠等先进封装技术,来解决存储器带宽与延迟瓶颈,在特定场景下实现极高的延迟优势。
展望NVIDIA GTC即将亮相的新品,可能基于下一代Feynman架构,目标着眼于将LPU的高效与GPU的通用算力结合,打造单位Token成本与延迟均大幅降低的“推理怪兽”。至于WSJ披露,OpenAI已承诺成为NVIDIA新芯片最大客户,或许也是对此技术路线的首次关键押注。