在Google Cloud Next 26年度盛会上,Google正式发布了两款全新的第8代TPU芯片:专为训练任务设计的TPU 8t和专注推理需求的TPU 8i。这是Google首次将AI训练与推理任务分开,由独立芯片分别承担,标志着其AI硬件战略的重大转变。
据Google介绍,TPU 8t擅长处理大规模、运算密集型的训练工作负载,能够提供更高的计算吞吐量和更强的可扩展带宽,从而缩短前沿模型的开发周期。而TPU 8i则拥有更高的存储器带宽,专为对延迟敏感的推理工作负载设计,能够支持复杂、协作、反复迭代的专业AI代理任务。
两款芯片首次运行在Google基于ARM架构的Axion CPU主机上,优化了整个系统的性能与效率。它们原生支持AX、MaxText、PyTorch、SGLang、vLLM等常用框架,并可作为Google AI超级计算机的一部分使用。此外,TPU 8t和TPU 8i在能源效率方面也有显著提升,与第7代TPU相比,每瓦性能分别提升了124%和117%。
Google强调,这两款芯片与Gemini协同设计,其架构细节充分考虑了当前AI模型的需求。例如,TPU 8i的SRAM容量依据量产级推理模型的KV缓存占用空间而定,而Virgo网络架构的带宽目标则根据万亿参数训练的并行性需求制定。
与2025年11月发布的第七代Ironwood TPU相比,TPU 8t在同等价格下性能提升了2.8倍,TPU 8i性能提升了80%。Google资深副总裁、AI与基础设施技术长Amin Vahdat表示,随着AI代理的兴起,业界需要更专门化的芯片来满足训练和部署的不同需求。
Google还通过全系统级能效优化,从芯片到数据中心实现了显著的能源效率提升。例如,将网络连接与计算整合在同一芯片上,降低了数据传输能耗。同时,采用第4代液冷散热架构,进一步提升了整体效率。与5年前相比,每单位电力的算力提升了6倍。
这一战略调整也被视为Google在AI硬件领域对NVIDIA发起的新一轮挑战。尽管Google是NVIDIA的大客户,但其TPU芯片一直作为云端客户的替代方案,展现了其在AI基础设施领域的长期布局。