页面加载中,请稍候
来源:半导体行业观察发布时间:2023-07-281238浏览
询问 AI来源:内容来自半导体行业观察(ID:icbank)综合,谢谢。
在过去的几周里,云中的人工智能超级计算选项以前所未有的速度扩展。
周三,亚马逊加入了这一行列,宣布在 AWS 中推出 EC2 P5 虚拟机实例,该实例将在 Nvidia H100 GPU 上运行。
P5 实例可以连接到称为 UltraScale 的 GPU 集群中,以提供高达 20 exaflops 的聚合性能。客户将能够在每个 UltraScale 集群中扩展至 20,000 个 H100 GPU。用户可以部署可扩展到数十亿或数万亿参数的机器学习模型。
Nvidia 副总裁 Swami Sivasubramanian 表示,与基于 Nvidia 上一代 A100 GPU 的 EC2 P4 模型相比,P5 实例在训练大型语言模型时速度提高了六倍,并且可以将训练成本降低 40%。在纽约 AWS 峰会上的主题演讲中,AWS 的数据库、分析和机器学习。
“当你训练这些大型语言模型时,它们是如此之大——数千亿和数万亿个参数——以至于你无法在任何时候将整个模型装入内存并能够进行训练。你必须能够将该模型拆分......在不同实例中的不同芯片上,”AWS 产品副总裁 Matt Wood 在纽约 AWS 峰会上说道。
谷歌今年早些时候发布了 A3 超级计算机,最多可容纳 26,000 个 Nvidia H100 GPU。Cerebras Systems 上周宣布将通过中东 IT 基础设施公司 G42 在云端部署人工智能超级计算机。
AWS 为 P5 实例部署了迄今为止最快的互连,实例之间的带宽为 3200Gbps,从而可以在训练过程中极快地同步权重。
“除了 Nvidia 芯片之外,我们还在 AWS 的网络结构后台做了很多工作,这使得带宽非常快,这是推动计算尽可能快的关键部分。Wood说道。
像 Bloomberg 这样的公司已经在 AWS 上创建了自己的大语言模型。其他人则使用 AWS 资源和现有的LLM来创建自定义机器学习应用程序。
AWS 正在采用不同的工具和中间件方法,以便客户采用机器学习。
今年早些时候,该公司推出了 Bedrock,它更像是一个基于云的游乐场,公司可以在其中尝试和构建大型语言模型。Bedrock 拥有许多大型语言模型,包括本月早些时候发布的 Meta 的 Llama 2。
在峰会上,AWS 还宣布在 Bedrock 上推出 Anthropic 的 Claude 2.0 聊天机器人模型。Bedrock还将支持Stable Diffusion XL 1.0,客户可以在其中输入文本来生成图像。
与谷歌或微软相比,亚马逊的人工智能方法有所不同,谷歌或微软拥有自己的专有模型,这些模型正在集成到搜索和生产力应用程序中。 相反,亚马逊希望提供transformer 型号的详尽列表,以便客户可以选择最佳选择。
亚马逊还推出了一套名为“代理”的工具,它将基础模型与外部数据源连接起来,为客户提供更加个性化的答案。数据可以存储在AWS或其他主机上,并可以通过API连接。
例如,代理商可以帮助将个人银行习惯与法学硕士联系起来,以回答客户的财务问题。
AWS 生成式 AI 副总裁 Vasi Philomin 告诉 HPCwire:“让客户能够非常快速地启动一个能够更新其最新数据的代理,这对于现实世界的应用程序来说非常重要。”
今天的大部分讨论都是围绕Agents的类型进行的,但未来的情况可能并非如此。
“我认为模型不会成为差异化因素。我认为区别在于你可以用它们做什么。对我来说,Agents是正确利用这些模型的第一步。”Philomin 说道。
AWS 上的 H100 GPU 实例的定价
在上世纪后期的IT 行业,供需的真正说明来自于为新的和二手的大型机和小型计算机系统制定季度定价指南。我们从中学到的很多东西中,有一个概念:事物的价格就是市场能够承受的价格。有时,购买昂贵且至关重要的系统的客户只能笑着忍受,因为不存在完美的需求和供给弹性,无法使所有这些曲线像教科书上看起来那样平滑。它变得参差不齐,有时,供应商是机会主义的,他们仅仅因为他们可以就对容量收取溢价。
20 世纪 80 年代末和 90 年代初的大型机是这样的——天啊,这玩意儿贵吗?GPU 加速系统也是如此,它们正在人工智能星系的核心产生引力。AI 硬件的成本,无论是购买还是租用,都是全球 AI 初创公司的主要支出,目前这些系统中大约 80% 到 85% 的资金都流向了 Nvidia 用于 GPU、系统板和网络。但是,像 Microsoft、Google 和 Amazon Web Services 这样的云提供商正在尝试从这种 AI 训练行动中分得一杯羹,正是考虑到这一点,我们拿出了值得信赖的 Excel 电子表格,并分析了AWS的 P5 GPU 实例的具体情况来自 AWS,它基于 Nvidia 的“Hopper”H100 GPU 加速器。
P5 实例是第四代基于 GPU 的计算节点,AWS 已将其用于 HPC 模拟和建模以及现在的 AI 训练工作负载(有 P2 到 P5,但不能有 P1),在这些节点中,有 6 个实例基于各种 Intel 和 AMD 处理器以及 Nvidia 加速器的几代 GPU 节点。值得注意的是,AWS 在这些 P 级实例中跳过了“Pascal”P100 一代;但不知怎么的,我们却忽略了这一点。AWS 早在 2016 年就使用 Nvidia“Kepler”K80 加速器测试了 HPC 水域,一年后直接跳到“Volta”V100,并推出了这些 Volta 实例的两个变体——第一个基于 Intel 的“Broadwell”Xeon E5 CPU ,
P5 实例采用一种尺寸:48 个超大,并具有八个 H100 和将它们全部连接起来的 NVSwitch 互连。这些 GPU 与具有一对 48 核 AMD“Milan”Epyc 处理器的节点相结合,该处理器具有 2 TB 内存、用于本地存储的 30 TB NVM-Express 闪存以及八个以 400 Gb/秒速度运行的 RDMA 网卡(总共 3.2 Tb/秒的聚合带宽)我们假设是以太网(不是 InfiniBand)加上来自 Nitro DPU 并进入 AWS 上运行的弹性块存储服务的 80 Gb/秒以太网带宽。H100 GPU 具有 80 GB HBM 内存,每个带宽为 3 TB/秒。这本质上是 Nvidia DGX H100 设计的变体。
AWS 在公告中表示,与之前的 P4 实例相比,新的 P5 实例将把大型语言模型的训练时间缩短六倍,并将模型训练成本降低 40%。造成这种情况的部分原因是 AWS 对其 A100 GPU 收取了溢价。
我们喜欢The Next Platform上比两代更长的趋势线,这就是为什么我们构建了一个显著特征表,其中汇集了 P2、P3、P4 和 P5 实例,以及按需或一年租用它们的成本或三年预留实例。而且,因为我们很疯狂,所以我们试图弄清楚 AWS 构建每个实例的成本是多少,AWS 容纳、供电和冷却这些实例的成本是多少,以及这些 P 级 GPU 实例的运营利润如何可能会与一段时间内 AWS 的总体运营利润率进行比较。看一看:
除了 P5 的一年预留(ne-year reserved)之外,所有这些实例的按需定价和预留定价都是真实的,我们认为三年预留是尝试计算 AWS 利润的一个很好的基础。从这些机器中提取数据,并找到一种方法将具有 20,000 个 H100 GPU 的 AWS UltraCluster(AWS 表示可以为使用 P5 实例的客户构建)与其他人已经构建、正在构建或有传言构建的其他巨型集群进行比较以万亿参数和万亿代币规模运行LLM。
如果使用 FP32 单精度浮点数学(K80s 没有 FP16 支持),AWS 提供的 GPU 节点从 P2 到 P5 的性能提高了 115 倍,但租用三个节点的价格年增加了 6.8 倍,这意味着性价比提高了 16.8 倍。从 2016 年到 2023 年,每个节点的功耗同期增加了约 8.1 倍。
为了计算上表中 P 级 GPU 节点的营业利润,我们假设了峰值功耗,我们意识到这是最坏的情况。我们计算了节点的用电量,然后添加更多的功耗来覆盖机器的冷却。(一般来说,数据中心设备的总电费中大约 40% 用于冷却,另外 60% 用于运行。)我们还计算了数据中心空间 30 年的成本(每台设备的电费在每瓦 7 至 12 美元之间,我们取中点为每瓦 9.50 美元),并在此基础上增加三年的成本。这是上图中的 AWS 设施成本。我们还估算了购买节点的成本及其在网络成本中所占的份额,这就是 AWS GPU 节点硬件成本所代表的内容。
假设最好的情况是所有这些 P 级实例都保留三年(这是消耗 AWS 云容量的成本最低的方式),您可以收回估计的硬件和设施成本并获得运营收入。我们展示了这一点,以及最接近这些实例推出的季度的 AWS 整体运营收入。(我们还没有来自 AWS 的 2023 年第二季度数据,因此我们必须使用第一季度数据与 P5 实例进行比较。)
正如您所看到的,租用一个 P5 实例(特别是唯一可用的实例是 p5.48xlarge,它是整个服务器节点)保留三年将花费您 113 万美元,这要低得多 –嗯,比按需租用此类容量(成本为 258 万美元)低 56.1%。三年内没有人会按需提供服务,但这一数学计算显示了每单位计算的相对价格取决于获取策略,这一点很重要。如果您知道您的需求,那么 AWS 可以将您置于供应曲线上,并为您提供可预测的折扣,这是供应需求曲线上的另一个轴。
正如您所看到的,假设我们的数学计算正确,即使存在所有这些成本,AWS 也将在这些 P5 实例上获得相当不错的运营利润。正如前几代 P 级所做的那样。假设将按需容量与预留实例混合在一起(60% 预留与 40% 按需),P5 实例三年内的总运营收入将翻倍。
有趣的是,AWS 从基于 GPU 的实例中获得的营业收入将为其提供所需的现金,用于投资用于人工智能训练的自研 Trainium 计算引擎和用于人工智能推理的 Inferentia 计算引擎。与英特尔和 AMD 的 X86 处理器相比,AWS 可以使用人工智能引擎,就像它使用自主研发的 Graviton Arm 服务器芯片一样:在其完全拥有的硬件堆栈上提供更好的性价比。
这确实是一个绝妙的策略,尤其是当 AWS 带来的利润意味着 Amazon 本身可以免费获得其庞大的 IT 业务来支持其各种且不断增长的业务部门时。
亚马逊表示,它可以将超过 20,000 个 H100 GPU 组合到 EC2 UltraCluster 配置中,并基于其 P5 实例提供 20 exaflops 的聚合峰值计算性能。这些 EC2 UltraCluster 在 P5 节点中拥有本地存储,并可以访问 Lustre 并行文件系统的 FSx 实现,该系统在 AWS 存储上运行,正如 AWS 所说,可以提供“每秒 PB 的吞吐量、数十亿次 IOP”。
考虑到我们上面列出的成本和租赁数据,我们将具有 20,000 个 H100 的 AWS EC2 UltraCluster 与我们知道正在云中或美国 HPC 中心构建的一些大型 AI 系统进行比较。随着我们添加供应商,这个表变得越来越有趣。看一下:
据我们所知,这些人工智能系统的价格不包括非经常性工程成本或电力和冷却成本。当然,从 AWS 租赁的 P5 集群确实如此,我们想要这样做是为了显示拥有成本和租赁成本之间的差异。美国能源部三个实验室的 Frontier、Aurora A21 和 El Capitan 机器主要针对 HPC 工作负载而设计,但根据其峰值聚合 FP16 性能评级,它们绝对将成为强大的 AI 机器。Inflection AI 机器由 Nvidia 和 CoreWeave 构建,而 Microsoft/OpenAI 机器据传由 Microsoft Azure 构建,因此 OpenAI 可以运行更大的模型,很可能是 GPT5。
Aurora 21 的价格因英特尔去年在其英特尔联邦部门核销的 3 亿美元而降低,我们认为这弥补了阿贡国家实验室这台机器延迟生产的成本。如果这确实发生了,那么阿贡国家实验室就得到了一笔非常划算的交易——而且也是值得的。不过,如果按照预期的 60 兆瓦电费计算,这将是一台非常热的机器,会消耗大量电力。
考虑到所有这些价格,以及 Cerebras Systems 为 AI 研究人员和云运营商 Group 42 (G42) 构建的 Condor Galaxy 集群的竞争力,您现在可以明白为什么 AWS 非常致力于其自研的 Trainium AI 训练计算引擎,并且为什么 Meta Platforms 也会研发自己的训练芯片。
因为按照这些价格,您也可以。
👇👇点击文末【阅读原文】,可查看原文链接!
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
今天是《半导体行业观察》为您分享的第3476期内容,欢迎关注。
推荐阅读
半导体行业观察
『半导体第一垂直媒体』
实时 专业 原创 深度
识别二维码,回复下方关键词,阅读更多
晶圆|集成电路|设备|汽车芯片|存储|台积电|AI|封装
回复 投稿,看《如何成为“半导体行业观察”的一员 》
回复 搜索,还能轻松找到其他你感兴趣的文章!
新闻来源:半导体行业观察,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
暂无评论哦,快来评论一下吧!

2026-07-20
2026-07-03

2026-06-24