在周三(22日)举行的Google Cloud Next 2026大会上,谷歌正式发布第八代张量处理器(TPU)的两款全新产品:专为AI模型训练设计的TPU 8t和专为推理优化的TPU 8i。这是谷歌首次将训练与推理任务拆分至独立芯片,标志着其AI硬件策略的重大转向。据《华尔街见闻》报道,这一策略调整旨在应对AI计算需求的分化。
谷歌两款芯片计划在今年晚些时候正式对外供应,通过专项优化满足日益分化的AI工作负载需求,并以更具成本效益的方式提供大规模吞吐量和低延迟,支持数百万个AI智能体同时运行。谷歌资深副总裁兼AI与基础设施技术长Amin Vahdat指出,业界将受益于针对训练和推理任务专门优化的芯片。
第八代TPU相比去年11月发布的第七代Ironwood有显著提升。TPU 8t在同等价格下效能提升2.8倍,TPU 8i效能提升80%。两款芯片的能源效率表现尤为亮眼,每瓦效能均较上一代提升超过一倍,其中TPU 8t达到124%,TPU 8i达到117%。此外,两款芯片均整合了基于安谋架构的Axion CPU,以消除数据预处理延迟造成的主机侧瓶颈,确保TPU运算单位持续满载运行。
TPU 8t定位为超大规模训练的算力引擎,号称能将前沿模型的开发周期从数月压缩至数周。在规模上,它最多可将9600块芯片组合为单一超级运算节点,并通过JAX与Pathways框架将分布式训练扩展至单一集群超过100万块芯片。其核心技术创新包括专门处理嵌入查找的SparseCore加速器、原生FP4支持(使MXU吞吐量翻倍并降低能耗),以及更均衡的向量处理单元扩展设计。
网络层面引进了全新的Virgo架构,数据中心网络带宽提升最高4倍,芯片间互联带宽提升2倍,单一网络可连接超过13.4万个芯片。存储方面则通过TPUDirect技术绕过CPU直接传输数据,存取速度提升10倍,确保处理大规模多模态数据集时算力不闲置。
TPU 8i则面向高并发推理场景,重心在于降低延迟与提升并发处理能力。其最显著的硬件特征是整合了384MB静态随机存取存储器,容量是上一代的三倍,可将更大的KV Cache保留在片上,大幅减少长上下文解码的等待时间。此外,它引入了集合加速引擎(CAE),专门加速自回归解码与思维链处理,使片上集合操作延迟降低5倍。
在网路拓扑上,TPU 8i放弃了传统的3D环面结构,转而采用全新的Boardfly互联拓扑,将最大跳数压缩至7跳,全对全通讯延迟改善最高50%。这对混合专家模型和频繁的跨芯片令牌路由极为有利。TPU 8i的Pod规模可扩展至1152块芯片,通过光学电路交换器实现组间互联。
TPU 8t由博通共同设计,主打极致性能,TPU 8i则首次与联发科合作,旨在优化成本与效率。这种双轨策略不仅让谷歌能分别针对训练和推理做深度定制,实现性能与成本的最优解,也通过多供应商布局打破了单一供应源的溢价与产能风险。