据法新社报道,未来几年,中国AI算力芯片可能形成GPU、TPU与NPU多种加速器并行发展的新格局。
在既有算力版图中,通用型GPU被视为AI训练的核心基石,其优势在于高度可编程性与成熟的软件生态,能支持模型训练、推理及高效能运算。然而,国内GPU厂商如壁仞科技、摩尔线程、天数智芯与燧原科技,虽在硬件参数上逐步接近国际水平,但NVIDIA凭借CUDA建立的软件生态护城河仍是难以逾越的障碍。受制于先进制程获取受限,本土GPU厂商目前更多聚焦于“替代”策略,通过优化软件工具链与适配主流模型,在大模型训练市场中维持一定的本土化算力供给。
相较之下,张量处理单元(TPU)被视为更具战略弹性的突围方向。TPU是专为深度学习张量与矩阵运算设计的特定领域架构,尽管制程条件相对成熟,却能在能效比上优于通用GPU,尤其适合云端推理与特定模型训练。以中昊芯英为代表的本土TPU厂商,正通过自研指令集与架构绕开对CUDA生态的依赖。这种技术路径不仅提升了自主可控性,还在中美科技竞争背景下具备战略安全意义。TPU的价值并非取代GPU,而是为算力体系开辟“效率优先”的专用场景。
在终端与边缘侧,神经网络处理器(NPU)则扮演着重要角色。NPU通常与CPU、GPU整合于SoC中,专注于AI推理任务,强调低功耗与实时低延迟反应。华为昇腾、寒武纪等本土厂商已将NPU广泛应用于安防、自动驾驶、智慧城市与工业场景。随着AI从模型训练走向大规模落地,推理算力需求预计将成为未来3至5年端侧市场的主要增长点,而这正是NPU的专长领域。
整体来看,国内算力产业正逐步形成多路并进的策略:GPU保持与国际主流生态的兼容性,TPU在云端推理与特定模型中追求效能突破,而NPU则深入垂直产业与边缘终端,承接AI落地需求。正如中昊芯英CEO杨龚轶凡所言,未来5至10年,国内可能出现更多TPU企业。