页面加载中,请稍候
来源:eetop发布时间:2023-06-061605浏览
询问 AI用模拟电路在存储器中进行神经网络处理将有助于节能。
应用指南下载->《数据中心以太网技术和向224Gbps的演进》机器学习和人工智能(AI)已经深入到日常生活和工作中,我们可能已经忘记与机器的交互曾经是什么样子。以前,我们通过数字键盘、电子表格或编程语言求得的都是精确的定量答案,比如“10的平方根是多少?”“按照这种利率,未来五年我的收益是多少?”等。
对大多数计算机来说,在外部存储器和计算资源(如CPU和GPU)之间移动大量数据耗费的时间成本和能源成本最高。这就是被称为“冯•诺依曼瓶颈”的存储与逻辑分离的经典计算机结构。要大大减少深度学习所需要的能量,有一种方法是避免移动数据,即在存储数据的地方进行计算。深度神经网络由多层人工神经元组成。每一层神经元根据神经元的“激活值”和连接下一层神经元的突触“权值”这两个值驱动下一层神经元的输出。大多数深度神经网络计算由向量矩阵乘法(VMM)运算组成,即向量(一维数字数组)与二维数组相乘。在电路级,这些运算为乘积累加运算(MAC)。对于每个下游神经元,所有上游激活值必须与相应的权值相乘,然后将这些乘积相加。大多数有用的神经网络太大,无法存放在处理器内存中,计算每一层网络时,都必须从外部存储器导入权值,每一次计算都要受到冯•诺依曼瓶颈的束缚。这使得数字计算硬件更支持更少从存储器中移动权值并能积极重复使用这些权值的深度神经网络。
2014年,我们在IBM研究实验室提出了一种全新的深度神经网络硬件节能方式。我们和其他研究人员一直在研究非易失性存储器(NVM)设备的交错阵列。交错阵列是一种将器件(例如存储单元)构建在两组正交水平导体(即所谓的“位线”和“字线”)之间的垂直空间的结构。我们意识到,只要稍作修改,我们的存储系统将非常适合深度神经网络计算,尤其是那些现有权值重复使用效果不佳的计算。我们将这一机遇称为“模拟人工智能”,其他从事类似工作的研究人员也将其称为“存储计算一体化”(processing-in-memory)或“存内计算”(compute-in-memory)等。
这些相同的模拟存内求和方法也可以使用闪存甚至是静态随机存储器(SRAM)单元来执行。静态随机存储器单元可以存储多个数字位,但不能存储模拟电导值。虽然我们不能将欧姆定律用于乘法那一步,但是我们可以使用一种方法获取这些存储设备的一位或两位的动态范围。然而,这种方法对噪声非常敏感,因此我们在IBM一直坚持研究基于相变存储器和电阻式随机存取存储器的模拟人工智能。
要使这种模拟人工智能方法真正取得成功,还有许多重要挑战需要克服。首先,根据定义,深度神经网络具有多层结构。要实现多层级联,我们必须通过人工神经元的激活作用(一种非线性函数)处理向量矩阵乘法瓦片的输出,并将其传递给下一个瓦片。非线性有可能通过模拟电路执行,并且以下一层所需的持续时间形式传达结果,但除了向量矩阵乘法的简单级联之外,大多数网络还需要其他运算。这意味着我们需要高效的模数转换(ADC),以及和瓦片之间进行适量的并行数字计算。新颖、高效的数模转换有助于避免这些电路对整体效率产生过多影响。最近,我们推出了一种基于相变存储器的高性能瓦片,使用了一种新型模数转换方法,可以帮助瓦片实现每瓦10万亿次以上的运算。
第二个挑战与非易失性存储器设备的特性有关,且更棘手。即使用相当低精度的数字描述它们的权值,数字深度神经网络的准确性也已经得到了证明。CPU经常使用的32位浮点数对深度神经网络是不必要的。使用8位浮点数甚至4位整数,深度神经网络通常也能工作得很好,能耗也很低。这为模拟计算带来了希望,只要我们能够保持类似的精度即可。鉴于电导精度的重要性,需要将表示模拟神经网络中的权值的电导值慢慢地、仔细地写入非易失性存储设备。与传统存储器(如静态随机存取存储器和电阻式随机存取存储器)相比,相变存储器和电阻式随机存取存储器的编程速度较慢,几个编程周期后会出现磨损。幸运的是,推理不需要经常重新编程权值。因此,模拟人工智能可以使用耗时的写验证技术来提高相变存储器和电阻式随机存取存储器的编程精度,且不必担心设备磨损。这种提升是非常必要的,因为非易失性存储器具有内在的编程噪声。电阻式随机存取存储器的导电性取决于几个原子形成细丝的运动;相变存储器的导电性取决于多晶材料中晶粒的随机形成。这两种随机性给数值的写入、验证和读取带来了挑战。此外,在大多数非易失性存储器中,电导会随温度和时间而变化。除此之外,还有相变存储器中的非晶相结构漂移、电阻式随机存取存储器中的细丝松弛或闪存单元中捕获的电荷泄漏等影响。
有几种方式可以巧妙地解决这个问题。使用两个电导对可以显著改善权值编程问题。其中,一对用于保存大部分信号,而另一对用于纠正主对上的编程错误。由于噪声在多个设备间平均,所以噪声降低了。
到目前为止,我们只讨论了推理,即将新数据作用于已经过训练的神经网络。但是,模拟人工智能还有帮助训练深度神经网络的其他机会。
模拟人工智能能否成功将取决于能否同时实现高密度、高吞吐量、低延迟和高能效。密度取决于非易失性存储器集成到芯片晶体管上方布线的紧密程度。瓦片级别的能源效率将受到模数转换电路的限制。
新闻来源:EETOP,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
暂无评论哦,快来评论一下吧!

2026-06-08

2026-07-23

2026-06-02