据NVIDIA消息,2026年NVIDIA GTC大会的主题演讲聚焦AI代理(AI Agent)这一核心议题。相比2023年至2024年讨论生成式AI,2025年关注实体AI(Physical AI),2026年的重点已明确转向推论算力,成为AI商业化的主战场。
NVIDIA创始人黄仁勋指出,AI训练只是起点,而推论才是AI应用的核心。生成式AI正从“聊天互动”向“思考决策、执行任务”演进,每一次用户交互和AI代理运行都依赖推论算力。为此,NVIDIA推出了Groq 3 LPU,作为推论算力的重要解决方案。
在硬件部署上,NVIDIA并未用LPU取代GPU,而是将256颗Groq 3 LPU装入一个LPX机架,与Vera Rubin NVL72机架并排部署。这种“算力阶层分化”策略与AWS的推理系统类似。AWS此前宣布在数据中心部署结合Tranium AI加速器和Cerebras Systems第三代CS-3的新型推理系统,将推论过程分为预填充(prefill)和解码(decode)两部分,以解决存储器带宽问题。
NVIDIA的Vera Rubin系统由7颗芯片组成,包括Vera CPU、Rubin GPU、NVLink 6交换芯片、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6以太网络交换芯片以及新整合的Groq 3 LPU。这套系统旨在实现从大规模预训练到实时推论的全流程覆盖,为代理式AI(Agentic AI)提供支持。
黄仁勋强调,Vera Rubin是NVIDIA有史以来最复杂的AI运算系统,其目标是让机器从“对话”进化到“工作”。LLM推论分为预填充和解码两个阶段,前者依赖GPU的运算能力,后者则需要极高的存储器读取速度。Groq 3 LPU专为解码阶段设计,芯片上堆叠了500MB的SRAM,以实现极致的推论性能。
NVIDIA通过Dynamo推论框架将流程拆分,使GPU和LPU协同工作,延迟减半。黄仁勋建议,针对高吞吐量的工作负载,可完全使用Vera Rubin;而对于需要大量程序设计和工程级token生成的场景,则可分配25%的数据中心功率给Groq。
推论算力的快速发展标志着AI商业化进入新阶段,NVIDIA与Groq的合作进一步凸显了推论市场的重要性。随着生成式AI向代理式AI迈进,推论算力已成为行业竞争的核心领域。