英伟达两百亿美元收购Groq,GPU与LPU咋分工?
来源:李智衍发布时间:2026-06-22436浏览
询问 AI据报道,英伟达计划于2025年底以200亿美元(约人民币1357.79亿元)的价格收购Groq。在2026年3月的GTC大会上,英伟达CEO黄仁勋宣布将Groq的LPU(语言处理单元)整合至最新的Vera Rubin平台中,并采用全新的芯片架构设计。针对外界对GPU为何需要结合LPU的疑问,Groq创始人兼CEO Jonathan Ross在近期的采访中详细解释了背后的整合逻辑。
在推理链路中,两家公司的产品扮演着不同的角色。Ross将英伟达GPU形容为“18轮重型大货车”,而把Groq LPU比作“最后一公里配送货车”。他指出,将这两种芯片结合使用,能够在大语言模型推理过程中,实现成本与速度的最佳平衡。这种协同部署的效果远优于单独使用其中任何一种芯片,未来市场也将涌现更多GPU与LPU混合部署的形态。
据Ross在访谈中透露,两者的分工主要基于“吞吐量”与“延迟”的考量。在读取输入文本的预填充阶段,由于该过程具有高度并行性且对单个词元(Token)的延迟不敏感,因此非常适合完全交由GPU来处理。
而在解码阶段,系统会根据用户对速度和成本的敏感度进行弹性配置。对于成本敏感型用户,可完全使用GPU进行解码;付费专业用户则采用GPU与LPU的混合模式;在追求极端性能的场景下,可考虑使用纯LPU解码。Ross表示,LPU凭借其SRAM架构和静态调度机制,在低延迟、小批处理大小的解码场景中具备显著优势。
在成本方面,GPU与LPU的每词元成本曲线形状完全不同,二者并非直接竞争关系,而是覆盖了不同的性能区间,形成互补定位。如果仅追求最低的每词元成本,使用GPU并配合极大的批处理大小即可,但生成速度会相对较慢。相反,LPU的优势在于能够跨多颗芯片进行扩展,完全依赖高速SRAM而非外部内存,从而在不显著增加成本的情况下,大幅提升词元的生成速度。英伟达将两者组合,可以在任意目标速度下实现最优的每词元成本和最大的算力容量。
对于AI算力市场的长期发展,Ross认为,算力单位成本的下降不仅不会压缩市场规模,反而会持续刺激总需求的增长。随着AI智能体(Agentic AI)应用的快速崛起,多个AI模型相互调用的任务分解模式正推动算力需求呈指数级扩张。当AI服务变得越来越便宜,且AI智能体将任务拆解为并行子任务、形成多层嵌套的调用模式时,算力的使用量将迎来爆炸式增长。因此,Groq与英伟达为市场提供的算力越多,市场的需求也就越大。
注:按1美元≈6.79人民币计算
新闻来源:李智衍,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。

