页面加载中,请稍候
来源:中国IC网发布时间:2021-11-271165浏览
询问 AI王少军博士认为,下一代有望实现10倍以上突破的指标是芯片利用率,这可能是未来解决计算能力需求的主流方法,而数据流架构能够实现这一目标,鲲云科技认为未来将有更多新兴AI芯片厂商加入到AI技术路线中。
如今,不同的应用场景对计算能力的要求越来越高,为满足需求,厂商不断提高AI芯片的峰值计算能力,而传统指令集架构的芯片利用率很难提高,在10-40%,这让芯片的实际性能在10-40%之间难以提高?
数据流架构有别于指令集结构,其显著特征是依靠数据流的流动顺序来控制计算的执行顺序,而不能控制指令的执行,所以将其应用于AI可以使芯片的利用率大幅度提高,直到达到100%。
如何提高数据流结构的芯片利用率
现在市面上的芯片主要有两种结构:B3W-1100一种是众所周知的指令集结构,主要包括X86体系结构、ARM体系结构、RISC-V开源体系结构、SIMD体系结构的简化、SIMD体系结构等。
该指令集体系结构采用冯诺依曼算法,以指令的顺序控制运算顺序,通过数据处理分离来提供计算的通用性。该体系结构采用数据流引擎计算,允许编译器同时安排多个顺序循环和功能,提高了吞吐量,降低了延时,显著提高了芯片利用率。
就像下面的左边一样,指令集模式首先执行函数A,然后执行函数B,依次类推,直到所有程序都被执行。在下面的右边,在数据流模式的情况下,编译器可以安排每一个功能在数据可用时立即执行,从而大大减少了等待和间隔的时间。
尽管数据流体系结构不像指令集体系结构那样为人所熟知,但数据流结构已成功地应用于专用硬件,例如,数字信号处理、网络路由、图形处理、遥感探测及数据库处理等,在很多软件架构中,包括数据库引擎设计和并行计算框架,这一点也很重要。
一九九四年,帝国理工学院教授、英国皇家工程院院士、鲲云技术联合创始人、首席科学家WayneLuk陆永青院士,是首批对数据流结构进行定制化和应用的人。目前,国际上越来越多地关注数据流技术,其中包括国外的SambaNova,Groq,Wavecomputing,以及国内的云计算。自去年谷歌TPU核心团队创立的Groq公司在斯坦福大学的SambaNova量产后,已量产了全球第一款数据流AI芯片CAISA,目前尚未发布产品。
资料流架构如何提高芯片利用率?从世界上仅有的大规模数据流AI芯片公司中,我们看到了鲲云的核心技术,即自定义数据流CAISA架构,这是一款为深度学习神经网络定制的高性能AI计算架构。CAISA体系结构通过数据流的流动顺序控制计算顺序,消除指令操作所带来的额外时间开销,使CNN网络的算子数据流图能够有效地进行流水运算。与此同时,CAISA可以并行执行数据存取和计算,进一步减少计算单元的空闲时间,最大限度地利用计算资源,以提供较高的实测能力。
这张照片来源于鲲云科技网站
麒麟科技合作伙伴、首席运营官王少军博士在一次电子发烧友网访谈中表示,之所以投身于定制数据流架构芯片的研发,一是鲲云科技有数据流架构技术研发基础,公司的创始团队来自数据流技术的源头实验室,这是全球三大定制计算实验室之一,自90年代以来,一直致力于数据流体系结构和不同领域的专门化架构研究,具有深厚的研发和迭代积累。
第二,更重要的是底层芯片技术存在算力瓶颈,随着摩尔定律的发展,基于摩尔定律提高芯片性能的成本日益增加,例如,一款5纳米芯片的研发成本就高达数亿美元,而在特定领域实现专门架构方面的性能优势将越来越大,直至其领先于通用计算芯片,麒麟科技认为,在计算能力飞速增长的时代,产业需要一颗高算力性价比的人工智能专用芯片,数据流架构的重要意义在于它突破了传统芯片架构对芯片利用率的限制,最大限度地发挥芯片自身的性能。
于是,鲲云科技在早期数据流架构技术的积累下,以人工智能领域为目标开发了CAISA体系结构,并最终实现了第一个数据流AI芯片从0到1量产。
云端CAISA芯片使用率达到95.4%
在去年六月,鲲云科技正式生产出世界上第一款数据流AI芯片CAISA,芯片使用率达95.4%,用于数据中心和边缘端的AI推理应用,虽然芯片使用28nm工艺,这一过程不会太高,但由于芯片利用率高,甚至在制程较低的情况下,CAISA芯片仍能提供较高的测量性能。
与此同时,鲲云科技还推出了三款基于CAISA芯片的高性能计算平台,其中包括面向边缘的星空X3加速卡、面向数据中心的星空X9加速卡、面向边缘AI应用的星空X6A边缘小站。星星X3加速卡主要针对8-16路视频进行实时结构分析,星空X6A边缘小站面向8路视频处理应用。
现在CAISA芯片和加速卡产品已经在多个领域得到应用,包括智慧安监、智能制造、智慧电力、智慧城市等。对于这些场景,王少军认为,对于国家生产的支柱产业来说,“降本增效”是刚需,例如在油田的应用场景,目前,传统安全监控系统已较为成熟,端侧摄像机监控系统已基本部署完毕,但视频结构的利用率不高,仅靠人工巡检,其工作范围广、环境复杂、耗时长、数据维度单一、人工识别困难、预警不及时、漏报概率高、事后取证困难。
对于这些行业痛点,鲲云科技提供了算法算力平台整合方案,以数据流AI芯片为基础的算力优势,以及计算力与算法联合优化的技术优势,该系统可实时采集500个视频信号,并对漏油、安全帽、工服、吸烟、电话、入侵报警及采油设备运行状况进行识别;实现了从视频流采集到输出报警时间为1s的采集,为油区生产提供了更加可靠的安全保障。数据流AI芯片在油田智能化升级的过程中突出了它的市场价值,能够充分利旧、快速部署、控制成本。
计算能力要求的未来主流解法
AI芯片的商业化落地,证实了深度学习与数据流融合的价值,王少军博士认为,数据流架构有可能成为下一代计算平台。在计算平台的演进过程中,他提到了十倍的核心绩效,这是计算架构代际更替的一个主要指标,例如X86到RISC计算平台,能源效率的比值提高了10倍以上;在X86到CUDA的计算平台上,运算能力也提高了10倍以上。
就历史脉络而言,相对于上一代主流算力平台,新算力平台的某一指标要高出10倍才能达到实测性能的显著提高,当摩尔定律放慢时,业界正日益关注下一代芯片将会如何发展,而底层架构的革新也已成为业界共识,产业也需要新的技术路线才能突破算力。
王少军博士认为,下一代有望实现10倍以上突破的指标是芯片利用率,这可能是未来解决计算能力需求的主流方法,而数据流架构能够实现这一目标,鲲云科技认为未来将有更多新兴AI芯片厂商加入到AI技术路线中。对目前的芯片制造商而言,技术路线的选择是公司的一大核心策略,而现有的发展生态和技术积累使得芯片制造商难以转型,但是一些玩家也看到了数据流技术的价值,例如英伟达推出了TensorCore,它以数据流技术为基础,以指令集为基础,以提高特定领域芯片使用效率。
总结
整体而言,数据流架构能显著提高芯片利用率,鲲云定制数据流CAISA新芯片的大规模商业化应用,也证实了数据流与深度学习融合的价值,相信未来AI将为AI带来一种新的技术研究方向,更多AI芯片厂商将加入到数据流架构技术的研究之中。
如今许多场景下AI芯片都有落地的刚需,特别是在边缘端,许多场景还存在“碎片化”的需求,所以厂商除了提高芯片利用率,在达到较高算力性价比的基础上,还需思考如何提高通用化、软件易用等,全面提升芯片性能,促进专用AI芯片大规模量产,赋予各行业智能升级动力。
新闻来源:中国IC网,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
暂无评论哦,快来评论一下吧!
2026-06-10

2026-06-23
2026-07-18