页面加载中,请稍候
来源:客服发布时间:2020-05-18436浏览
询问 AI
亚马逊(Amazon)研究人员提出将人工智慧(AI)用于多声源定位(multiple-source localization)的方法。在涉及真实和模拟数据及多达3个声源的实验中,该方法较最先进的讯号处理模型改进近15%。论文5月在国际声学、语音和讯号处理国际会议(ICASSP)上发表。
根据VentureBeat报导,解决多声源定位问题是开发智慧音响、智慧显示器甚至视讯会议软体必不可少的步骤。多声源定位是波束成形(beamforming)的核心。亚马逊Echo系列产品利用波束成形来提高语音辨识的准确性。
朝向麦克风阵列传播的声音将在不同时间到达每个麦克风,这种现象可用来判断声源的位置。就单个声源而言计算相对简单,但多个声源计算将成倍地复杂。
目前已有不少多声源定位问题的AI和机器学习方案,但其中许多都有局限性。当可能声源数量超过模型输出数量时就无法确定哪个声源对应哪个输出。
亚马逊小组的模型首先将声源定位到粗略定义的区域,然后再在这些区域内精确定位声源。若包含至少一个声源,则会认定该区域处于活动状态,并且假定在任何活动区域中最多能有一个活动声源。由于每个粗略定义的区域在模型的输出层中都有一组指定的节点,因此对于给定区域中的哪个声源与位置估计相关联就不会有歧义。
而每个区域模型都会计算出包含一个声源的概率,声源与麦克风阵列中心之间的距离,以及声源相对于阵列的角度。会从麦克风中摄取多通道原始音讯,并输出上述3个量,从而实现端到端的处理。该模型处理原始音讯,因此无需进行预处理。
新闻来源:飞行日记,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
暂无评论哦,快来评论一下吧!

2026-06-17

2026-06-15