基于BERT-CNN的新闻文本分类的知识蒸馏方法研究
来源:电子技术应用ChinaAET发布时间:2023-01-30698浏览
询问 AI
作者:叶榕,邵剑飞,张小为,邵建龙作者单位:1.昆明理工大学 信息工程与自动化学院,云南 昆明 650500。摘要:近年来,随着大数据时代进入人类的生活之后,人们的生活中出现很多无法识别的文本、语义等其他数据,这些数据的量十分庞大,语义也错综复杂,这使得分类任务更加困难。如何让计算机对这些信息进行准确的分类,已成为当前研究的重要任务。在此过程中,中文新闻文本分类成为这个领域的一个分支,这对国家舆论的控制、用户日常行为了解、用户未来言行的预判都有着至关重要的作用。针对新闻文本分类模型参数量多和训练时间过长的不足,在最大限度保留模型性能的情况下压缩训练时间,力求二者折中,故提出基于BERT-CNN的知识蒸馏。根据模型压缩的技术特点,将BERT作为教师模型,CNN作为学生模型,先将BERT进行预训练后再让学生模型泛化教师模型的能力。实验结果表明,在模型性能损失约2.09%的情况下,模型参数量压缩约为原来的1/82,且时间缩短约为原来的1/670。引言:随着大数据时代的到来,今日头条、新浪微博和豆瓣等主流新闻媒体APP产生海量新闻文本,因此如何将这些新闻文本进行快速有效的分类对于用户体验乃至国家网络舆情控制是十分必要的。针对中文新闻文本分类任务,研究者提出许多分类算法和训练模型,证明深度学习分类方法的有效性。以BERT[1](Bidirectional Encoder Representation from Transformers)预训练模型为例:在文献[2]的实验中可以得出,BERT-CNN模型取得的效果最佳,但是从工程落地的角度来说,模型参数量过于巨大,仅仅一个BERT模型,参数就达一亿多。本文使用的是谷歌开源的面向中文的BERT预训练模型,占用内存大小为325 Mb。另一方面,针对训练时间过长的缺点,以该实验为例,训练18万条新闻文本数据消耗的时间为3.5 h,很显然对于未来的模型工程落地还存在很大的差距。因此,本文在保证不下降过多模型的准确率的前提下,将BERT-CNN进行模型压缩,降低模型体积以及模型的训练时间,提升模型的泛化能力。本文创新点主要体现在:(1)对实验数据集进行了扩充处理,提升模型泛化能力;(2)通过观察不同的T和α的组合对模型蒸馏性能的影响确定最优组合值而不是固定值;(3)蒸馏场景不再局限于传统情感分析(二分类),本实验面向10分类的文本分析,不同标签文本的蒸馏性能也不尽相同。文章来源:《电子技术应用》杂志1月刊点击下方阅读原文,下载论文PDF


☞商务合作:☏ 请致电010-82306118 /✐ 或致件 Tiger@chinaaet.com
点
这里“阅读原文”,直达电子技术应用官网
新闻来源:电子技术应用ChinaAET,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。