AI运算需求增 服务器、网络大提升
来源:李立达发布时间:2023-10-111501浏览
询问 AI生成式AI(Generative AI)背后的大型语言模型(LLM),需要处理庞大数据,进行训练与更高速的传输,也为厂商带来更多商机。更值得关注的是,除硬件建置外,后续在软件的应用更值得期待。华硕云端暨台智云总经理吴汉章以AI 1.0与2.0,为生成式AI与过去的AI划出清楚分界线。
吴汉章指出,AI 1.0是透过监督学习,建立特定模型,过程需要建立专案、贴上标签,在不同模型要经过同样的过程,但只能解决特定问题。AI 2.0的生成式AI却不同,建立模型后,可自行学习,从应用面来看,生成式AI更聪明也更多工。
AI 2.0背后所需要消化训练的数据量,也远大于之前的AI模型。过去参数量仅以万为单位,如今生成式AI需要数十亿到数百亿笔参数量。吴汉章指出,很多人用ChatGPT会觉得机器聪明,因为当超过400亿~600亿笔参数后,就过了「顿悟」的门槛。
OpenAI GPT-3的参数量为1,750亿个,GPT-3.5参数量约2,000亿个,GPT 4的LLM在2023年3月14日公布,却没有揭露其使用的参数量。外界估计,GPT4应大过GPT3数倍,也有人猜测其参数量高达1万亿个。
为了让AI更聪明,使参数量增加,对应的是硬件设备需提升。过去仅需1颗GPU或甚至CPU可达到的架构,如今需要上百颗GPU平行运算,其服务器、网络交换器,以至于整个数据中心的架构,都需要改变。
若单纯从服务器来看,因应NVIDIA HGX模块的散热需求,所采用的3D VC架构,散热鳍片高度就达3U(13.35厘米),因此机箱需要采用4U以上规格。当机箱越高,里面的机构件设计必须改变,比如风流、风压,都须重新设计,机箱本身的承重与材质,也都需要纳入考量。
上述为气冷设计,若考量到电力使用效能(PUE),液冷设计会是解法之一,然其变化更大,从水冷板、水冷头与管线、CDU,都须纳入考量,水冷最受诟病的漏液问题如何解决?迄今也无人可100%保证;另一项浸没式散热,从单相到两相,也有不同问题需要解决。
机构件之外,还有电源需要考量,包括功率提高,电源体积越大,然放置空间有限,其次随着瓦特数提升,电源本身的转换效率将达到钛金(97%以上)等级,另外,不只服务器本身用电量增,整个数据中心的用电设计也要往上提高。
服务器之外,还有网络交换器的架构也需改变。传统的数据中心架构透过PCIe Switch,连结CPU与GPU NIC,然若要进行AI或机器学习的数据传输,此架构会面临3种限制,包括无法适当扩充、较低的效能表现以及较高的传输延迟(Latency)。
网络交换器厂智邦指出,新一代的数据中心需采用另一架构,优化AI与机器学习流程,此架构是透过服务器加速器(Server Fabric Accdelerator)与NIC及存储器的CXL技术结合,让AI或机器学习可弹性扩充,并减少其中的传输延迟,此设计仍需测试,然会是AI网络架构的方向。
责任编辑:罗立邦
新闻来源:DIGITIMES科技网,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。


