页面加载中,请稍候
来源:半导体行业观察发布时间:2023-04-171550浏览
询问 AI来源:内容由半导体行业观察(ID:icbank)编译自hpcwire,谢谢。
铜线在计算机之间传输数据的速度是有限的,向光速的转变最终将推动人工智能和高性能计算向前发展。每家主要芯片制造商都同意,需要光互连才能以节能方式实现 Zettascale 计算——AMD首席执行官 Lisa Su 上个月分享了这一观点。
谷歌已经在其数据中心试验并部署了服务器和芯片之间的光学互连。在本月初发布的 arXiv论文中,该公司分享了有关其实施以及性能和能效提升的详细信息。
谷歌谈到了 TPU v4 超级计算机,它拥有 4,096 个公司的张量处理单元 (TPU)。谷歌在 TPU 芯片上运行其 AI 应用程序,其中包括 Bard,这是该公司注入 AI 的搜索引擎的早期迭代。该公司已在谷歌云中部署了数十台 TPU v4 超级计算机。
谷歌关于其超级计算基础设施的论文是在微软对其使用 Nvidia GPU 的 Azure 超级计算机大肆宣传之后发布的,该 GPU 为 ChatGPT 提供支持。相比之下,谷歌在其网络应用程序中部署 AI 方面一直比较保守,但现在正努力追赶微软,后者已在其 Bing 搜索引擎中部署了 OpenAI 的 GPT-4 大语言模型。
几十年来,光学连接一直用于通过电信网络进行长距离通信,但现在被认为在数据中心中用于短距离通信的时机已经成熟。Broadcom 和 Ayar Labs 等公司正在开发用于光互连的产品。
谷歌的 TPU v4 超级计算机于 2020 年部署,该论文作为回顾性文章撰写,衡量多年来的性能提升。
谷歌研究人员在一封电子邮件中告诉HPCwire,这台超级计算机是“第一台采用电路交换光学互连的计算机” 。它共有 64 个机架,托管 4,096 个 TPU,另外还有 48 个光电路交换机连接整个系统的所有机架。谷歌计算出,光学组件占系统成本的不到 5%,占系统功耗的不到 2%。
谷歌研究人员写道,TPU v4 芯片的性能优于 TPU v3 芯片 2.1 倍,每瓦性能提高 2.7 倍。“TPU v4 超级计算机在 4096 个芯片上大了 4 倍,因此整体速度提高了约 10 倍,这与 OCS 的灵活性一起有助于大型语言模型,”研究人员在论文中说。
谷歌强调了光学在部署系统和根据应用动态调整拓扑方面的灵活性;光互连及其高带宽允许每个机架独立部署,并且每个机架都可以在生产完成后插入。
“增量部署极大地缩短了生产使用时间,从而提高了 TPU v4 超级计算机的成本效益,”研究人员说。
对于前身 TPU v3 超级计算机来说,情况就完全不同了,它共有 1,024 个 TPU 芯片。“在安装和测试所有 1,024 个芯片和所有电缆之前,TPU v3 系统无法使用。任何组件的交付延迟都会拖累整个超级计算机,”研究人员写道。
与 Nvidia 的基于电气的 NVSwitch 相比,谷歌将其光电路交换描述为下一代互连。光开关是“通过镜子连接的光纤,因此通过光纤运行的任何带宽都可以通过今天跨越 4,096 个芯片的 OCS 在输入和输出光纤之间切换,”谷歌研究人员说。
互连将可扩展到更多的 TPU 内核,并且可以建立每秒多个 TB 的链接。
该研究论文将 TPU v4 芯片与 Nvidia 的 A100 芯片进行了比较,后者也是 2020 年使用的,采用 7nm 工艺制造。Nvidia 最近的 Hopper H100 直到今年早些时候才在云中可用,谷歌保留了将其下一代 TPU v5 与 H100 进行比较的选项。
谷歌声称它的芯片可以胜过 A100 和 Graphcore 的 AI 芯片,但研究人员也对 MLPerf 等 AI 基准测试发表了意见,MLPerf 衡量训练和推理的峰值性能。谷歌研究人员声称其 TPU v4 芯片在现实场景中可以更好、更相关地使用计算资源。
“HPC 社区熟悉 Linpack 性能与实际应用程序性能之间的差距,ACM 戈登贝尔奖认可了这一点。最近的获胜者在几台 HPC 超级计算机上达到了 Linpack 每秒 5%-10% 的失败率。正如论文所提到的,峰值和交付的 AI 性能不一定相关。我们感到自豪的是,一个大型语言模型在 50 天内平均达到了 TPU v4 峰值硬件性能的 58%,”谷歌研究人员在回答 HPCwire 的问题时说。
TPU v4 超级计算机包括 SparseCores,这是一种更接近高带宽内存的中间芯片,许多 AI 运算都发生在该芯片上。SparseCores 的概念支持 AMD、英特尔和高通等公司正在研究的新兴计算架构,该架构依赖于计算更接近数据,以及数据进出内存之间的协调。
这篇论文用了很多篇幅将 TPU v4 超级计算机与 Nvidia 的 A100 在性能和能效指标方面进行了比较。尽管如此,谷歌通常会优化其应用程序以在其 TPU 上进行处理,这并不能使其成为同类比较。
谷歌将光路开关用于其他应用,它在去年的一篇论文中对此进行了详细介绍,但这是它首次创建大规模光互连。
👇👇点击文末【阅读原文】,可查看原文链接!*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
今天是《半导体行业观察》为您分享的第3374期内容,欢迎关注。
推荐阅读
半导体行业观察
『半导体第一垂直媒体』
实时 专业 原创 深度
识别二维码,回复下方关键词,阅读更多
晶圆|集成电路|设备|汽车芯片|存储|台积电|AI|封装
回复 投稿,看《如何成为“半导体行业观察”的一员 》
回复 搜索,还能轻松找到其他你感兴趣的文章!
新闻来源:半导体行业观察,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
暂无评论哦,快来评论一下吧!
2026-06-26

2026-06-18
2026-07-02