页面加载中,请稍候
来源:核芯产业观察发布时间:2020-07-131590浏览
询问 AI几乎每一家芯片公司都在对标英伟达,这使得人工智能硬件的竞争进入白热化阶段。
不过,做AI芯片就像长跑,制胜的关键不是瞬间的爆发力,而是跑下整场比赛的平均速度。一家初创公司正在以这样的思路,试图跑赢英伟达。
“做AI芯片有两条路。第一条路就是基于传统的指令集架构,这条路相对容易,但是在芯片利用率上很难拉开差距。现在做到最好的英伟达T4可以做到130TOPS、12nm工艺,在每一个指标上已经非常领先了,在这种情况下,我们在这条路上比拼峰值算力和工艺,是非常难的。”鲲云科技创始人兼CEO牛昕宇博士表示,“对于所有的AI芯片企业其实还有另外一条路,这条新的道路追求的是芯片利用率,追求的是用已有的芯片成本提供更高的性能。”

鲲云科技创始人 牛昕宇
AI芯片研发新方向——实测3.91倍T4性能提升
日前,鲲云科技宣布CAISA芯片已量产,号称全球首款数据流AI芯片,定位于高性能AI推理。在实测算力上,较同类产品在芯片利用率上提升了最高11.6倍。第三方测试数据显示仅用1/3的峰值算力,CAISA芯片可以实现英伟达T4最高3.91倍的实测性能。
牛昕宇介绍,数据流架构为AI芯片的发展提供了提升峰值性能之外的另一条技术路线。鲲云科技通过CAISA数据流架构提高芯片利用率,同样的实测性能,对芯片峰值算力的要求可大幅降低3-10倍,从而降低芯片的制造成本,为客户提供更高的算力性价比。
CAISA芯片搭载了四个CAISA 3.0引擎,具有超过1.6万个MAC(乘累加)单元,峰值性能可达10.9TOPs。该芯片采用28nm工艺,通过PCIe 3.0×4接口与主处理器通信,同时具有双DDR通道,可为每个CAISA引擎提供超过340Gbps的带宽。
CAISA芯片架构图
基于CAISA芯片的星空系列边缘和数据中心计算平台X3加速卡和X9加速卡同时发布,目前X3已量产,X9将于今年8月推出市场。
根据人工智能产业技术联盟(AIIA)测试的包括ResNet-50、YOLO v3等在内的主流深度学习网络的实测性能来看,X3和X9加速卡在芯片利用率、延时、性能等方面都有大幅提升。
星空X3加速卡是搭载CAISA芯片的数据流架构深度学习推断计算平台,为工业级半高半长单槽规格的PCIe板卡。它具有轻量化的特点,可以与不同类型的计算机设备进行适配,包括个人电脑、工业计算机、网络视频录像机、工作站、服务器等,满足边缘和高性能场景中的AI计算需求。
相较于英伟达边缘端旗舰产品Xavier,X3可实现1.48-4.12倍的实测性能提升。
图表:<电子发烧友>据鲲云资料制表

X3 vs Xavier 芯片利用率对比图

X3 vs Xavier 性能对比图

X3 vs Xavier 延时对比图
星空X9加速卡为搭载4颗CAISA 芯片的深度学习推断板卡,峰值性能43.6TOPS,主要满足高性能场景下的AI计算需求。同英伟达旗舰产品T4相对,X9在ResNet-50、YOLO v3等模型上的芯片利用率提升2.84-11.64倍。在实测性能方面,X9在ResNet50可达5240FPS,与T4性能接近,在YOLO v3、UNet Industrial等检测分割网络,实测性能相较T4有1.83-3.91倍性能提升。在达到最优实测性能下,X9处理延时相比于T4降低1.83-32倍。

图表:<电子发烧友>据鲲云资料制表

X9 vs T4 芯片利用率对比图

X9 vs T4 性能对比图

X9 vs T4 延时对比图
如何提升芯片利用率?数据流架构另辟蹊径!
据了解,CAISA芯片采用鲲云自研的定制数据流芯片架构CAISA 3.0,相较于上一代芯片架构,CAISA 3.0在架构效率和实测性能方面进一步提升,并在算子支持上更加通用,支持绝大多数神经网络模型快速实现检测、分类和语义分割部署。
CAISA3.0在多引擎支持上提供了4倍更高的并行度选择,架构的可拓展性大大提高,在AI芯片内,每一个CAISA都可以同时处理AI工作负载,进一步提升了CAISA架构的性能,在峰值算力提升6倍的同时保持了95.4%的芯片利用率,实测性能线性提升。同时新一代CAISA架构对编译器RainBuilder的支持更加友好,软硬件协作进一步优化,在系统级别上为用户提供更好的端到端性能。

CAISA3.0架构图
牛昕宇介绍,现在主流的AI芯片多数都是基于指令集的计算架构,背后是冯诺伊曼计算体系。其显著特征就是计算和控制是分离的,这样会带来一个好处——它很通用。但与此同时,也带来了指令执行的不确定性,因为它是通过指令执行次序控制计算顺序,也就是说,当前指令依赖于前一个指令的执行情况,一定要在它之后执行才能保证计算的正确性。当它不确定时,只有等待,这就带来空间的闲置。
而CAISA架构依托数据流流动次序控制计算次序,采用计算流和数据流重叠运行方式消除空闲计算单元,并采用动态配置方式保证对于人工智能算法的通用支持,突破了指令集技术对于芯片算力的限制。
此次完成3.0升级,CAISA架构解决了数据流架构作为人工智能计算平台的三大核心挑战:
在保持计算正确前提下,通过不断压缩每个空闲时钟推高芯片实测性能以接近芯片物理极限,让芯片内的每个时钟、每个计算单元都在执行有效计算;
在保证每个算法在CAISA上运行能够实现高芯片利用率的同时,CAISA3.0架构通用支持所有主流CNN算法;
通过专为CAISA定制的编译工具链实现算法端到端自动部署,用户无需底层数据流架构背景知识,简单两步即可实现算法迁移和部署,降低使用门槛。
AI计算平台如何满足“三高”要求?
AI计算平台意味着什么?不止是高算力性价比,还要满足高架构通用性、高软件易用性,这夯实了给用户提供的基础价值。具体来讲,鲲云CAISA3.0架构的三大技术突破主要通过以下方式实现:
CAISA3.0架构由数据流来驱动计算过程,无指令操作,可以实现时钟级准确的计算,最大限度减少硬件计算资源的空闲时间。CAISA3.0架构通过数据计算与数据流动的重叠,压缩计算资源的每一个空闲时钟;通过算力资源的动态平衡,消除流水线的性能瓶颈;通过数据流的时空映射,最大化复用芯片内的数据流带宽,减少对外部存储带宽的需求。
上述设计使CNN算法的计算数据在CAISA3.0内可以实现不间断的持续运算,最高可实现95.4%的芯片利用率,在同等峰值算力条件下,可获得相对于GPU 3倍以上的实测算力,从而为用户提供更高的算力性价比。
CAISA3.0架构可以通过流水线动态重组实现对不同深度学习算法的高性能支持。通过CAISA架构层的数据流引擎、全局数据流网、全局数据流缓存,以及数据流引擎内部的人工智能算子模块、局部数据流网、局部数据流缓存的分层设计,在数据流配置器控制下,CAISA架构中的数据流连接关系和运行状态都可以被自动化动态配置,从而生成面向不同AI算法的高性能定制化流水线。
在保证高性能的前提下,支持用户使用基于CAISA3.0架构的计算平台实现如目标检测、分类及语义分割等广泛的人工智能算法应用。
专为CAISA3.0架构配备的RainBuilder编译工具链支持从算法到芯片的端到端自动化部署,用户和开发者无需了解架构的底层硬件配置,两步即可实现算法快速迁移和部署。
RainBuilder编译器可自动提取主流AI开发框架(TensorFlow,Caffe,Pytorch,ONNX等)中开发的深度学习算法的网络结构和参数信息,并面向CAISA结构进行优化;工具链中的运行时(Runtime)和驱动(Driver)模块负责硬件管理并为用户提供标准的API接口,运行时可以基于精确的CAISA性能模型,实现算法向CAISA架构的自动化映射,同时提供可以被高级语言直接调用的API接口;最底层的驱动可以实现对用户透明的硬件控制。可以让用户快速和低成本的部署和迁移已有算法到CAISA硬件平台上。

RainBuilder架构图
下一代AI计算平台的落地启示
芯片在AI领域处于战略性的地位。这样一个战略性的芯片应该怎么做才能给用户带来实际的价值?是不是还有新的路径可以为用户提供更大的价值,而不只是限于性能、工艺等比拼?在这方面,鲲云走出了一条全新的技术路线,也给其他聚焦于AI基础层技术的创业公司,带来了一定的启发。
“今天所展示的很多应用,仅是AI的冰山一角。从自动驾驶到智慧城市再到智能制造,AI在深刻改变着我们的生活。这其中,计算平台起到什么价值?因为所有的计算领域都需要一定的性能,才能满足落地要求。另一方面,所有算法都需要附着在芯片上,完成最后一公里的部署”,牛昕宇表示,“而这也正是下一代AI计算平台提供的价值:一方面提供更好的AI应用或者性能更高、各项表现更好;另一方面,能够降低AI的落地成本。”
目前,CAISA的芯片利用率已经超过95%了,这也表明它未来的提升空间只有4%点多。未来又将如何继续优化呢?牛昕宇表示,未来更多的是软件方面的提升,从软件易用性出发,让用户更方便去部署。
CAISA架构本身还处于不断迭代的过程中。据了解,未来的升级方向还是围绕如何给用户创造更大的价值。因为用户常用的算法都会进行迭代,通过软件迭代在现有架构中进行支持,或是通过架构升级,支持用户更多的算法网络。鲲云一方面将自主研发AI芯片,提供一体化计算平台设备,保证产品标准化,降低AI落地成本。另一方面,将提供与CAISA芯片配套的落地解决方案,降低鲲云计算平台的落地门槛与使用难度。

声明:本文由电子发烧友原创。
新闻来源:核芯产业观察,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
暂无评论哦,快来评论一下吧!

2026-07-17
2026-06-10

2026-07-09