据外媒报道,谷歌近期发布了第八代TPU,并将其分为训练专用TPU 8t和推理专用TPU 8i。这一举措不仅标志着AI芯片设计从通用加速器向专用加速器的转变,也反映出超大规模AI基础设施的需求正变得更加复杂。
大型语言模型(LLM)的快速发展,使得训练和推理任务在算力需求、存储器访问、时延目标等方面出现明显分化。谷歌通过两款芯片分别优化训练和推理负载,展现了其在AI基础设施领域的垂直整合能力。TPU的背后不仅是一颗芯片,更涉及编译器、框架、互连、集群调度等多个环节,任何一环的短板都会削弱专用芯片的优势。
谷歌并非唯一一家采取类似策略的公司。亚马逊AWS早在AI芯片研发初期,就意识到推理与训练任务需要分别优化。其自研芯片Graviton与Trainium 3的组合也采用了类似的设计思路。此外,NVIDIA的Blackwell Ultra系列也尝试针对推理任务进行优化,但目前的分化程度仍不及谷歌。
从商业角度看,训练是一次性投入,而推理则是持续性开销。随着模型上线后需要处理千万甚至上亿级别的请求,推理成本已成为AI基础设施的关键。谷歌将TPU分拆为训练和推理专用芯片,正是为了应对这一现实需求。这种架构分化不仅是为了技术演进,更是为了优化系统总成本。
谷歌强调“AI代理时代”的到来,也为其芯片设计提供了方向。AI代理类应用的推理负载更加复杂,可能涉及高强度矩阵运算、存储器读写以及外部工具调用等。这种不规则负载对推理芯片提出了更高要求,而第八代TPU正是为此类未来场景做好准备。
随着AI任务的多样化发展,“一个芯片包打天下”的时代正逐渐退潮。训练和推理的经济学差异,使得两者优化目标分叉,芯片设计也随之分化。谷歌TPU分拆的意义不仅在于技术本身,更在于其展示了围绕不同负载重构整个系统的能力。这种能力将成为未来AI芯片竞争的关键。
对于NVIDIA而言,谷歌的TPU分拆虽未构成直接威胁,但长期来看,专用加速器的兴起可能侵蚀其通用GPU的利润空间。AI芯片的未来或将走向场景化和专用化,而谁能更早看清不同负载的瓶颈,谁就能在竞争中占据先机。