为啥手机siri谁都可以喊出来(揭秘Siri语音唤醒原理)
如果有更好的建议或者想看更多关于技术大全及相关资讯,可以多多关注茶馆百科网。

随着人工智能技术的快速发展,人机语音交互更加自然,配备语音唤醒和识别技术的智能设备也越来越多。在学术上,基于语音的唤醒被称为关键字识别,简称KWS,它实时检测说话者在语音流内的特定片段(如Tinker bell、Hi Siri等),是一种小型的资源关键字搜索任务,也可以看作是一种特殊的语音识别,应用于智能设备中可以保护用户隐私,降低设备功耗,往往起到激活设备、打开系统入口的作用。在手机助手、汽车、可穿戴设备、智能家居、机器人等领域尤为普遍。
判断唤醒效果的指标有四个:召回、虚警、响应时间和功耗。召回率表示正确唤醒的次数占假定唤醒总数的百分比。虚警率是指在不应被唤醒的情况下被唤醒的概率。业界常以12小时或24小时内的虚警次数作为系统虚警率的评价指标。响应时间是指用户说出唤醒词后设备的响应时间。太长的响应时间会导致糟糕的用户体验。功耗指唤醒系统的功耗。大多数智能设备都是电池供电的,需要能够长时间运行。因此,唤醒系统必须低功耗。一个好的唤醒系统应该保证高召回率、低虚警率、短响应延迟和低功耗。
唤醒技术的难点在于如何在低功耗下实现高性能。一方面,为了控制成本,很多智能设备搭载的都是一些低端芯片,计算能力有限,因此需要唤醒模块,尽可能减少计算量,以降低能耗。一方面,用户场景多种多样,设备往往没有专业的声学设计,因此在远场、噪声大、干扰强、回声高、混响高的条件下,仍然面临召回率低、虚警率高的问题。
为了解决这一问题,腾讯AI实验室最近发表了一篇论文,针对复杂的声学环境,特别是噪声和人类语音干扰的场景,对发送给唤醒模型的声学信号进行预处理,以提高其语音信号的质量。本文已被Interspeech 2020录用。
许多智能设备都配备了多个麦克风,因此采用多通道前端处理技术对前端信号进行唤醒处理。当目标扬声器和噪声源分布在不同方向时,波束形成等多通道语音增强技术可以有效地增强目标扬声器并抑制其他噪声源。但这种方法依赖于更准确的目标说话人方向。在实际环境中,由于噪声源的存在,很难从有噪声的数据中准确估计目标说话人的位置,特别是当有很多人同时说话时,无法判断哪个是目标说话人。因此,本文采用“全方位聆听”(多音范围)的思路,在需要增强的空间中设置多个看向,从而区别于传统的波束形成方法(已在ICASSP 2020[1]上发表)。本文提出了一种基于神经网络的多视语音增强模型,该模型可以同时增强多个方向声源。这些多向增强的输出信号通过注意机制的特征融合发送到唤醒模型。由于前端的增强是由神经网络处理的,因此可以将增强模型和唤醒模型联合优化,实现多音语音唤醒的前端和后端真正一体化。
基于神经网络的多音语音增强模型是第一个完全基于神经网络的语音增强模型。与特定方向的语音增强相比,该模型可以同时增强多个方向的声源。同时,基于神经网络的波束形成方法在性能上明显优于传统的波束形成方法。在神经网络多音前端的基础上,与唤醒模型联合训练,进一步提高了模型的鲁棒性和稳定性。该模型适用于多麦克风设备的语音唤醒。
以下是该方案的详细说明。
传统的多音语音处理思路是在空间上设置几个待增强的注视方向,在每个方向上进行波束形成,对该方向的声源进行增强。最后,本文将各个方向增强的输出信号依次发送到唤醒模块,只要有一个方向可以触发唤醒。唤醒成功。这种基于多音带的多波束唤醒技术大大提高了噪声下的唤醒性能。但是需要多次调用唤醒模块,与单次唤醒相比,计算量增加了一倍,且功耗高,限制了应用。针对这一情况,笔者在之前的工作[1]中将注意机制引入唤醒框架。如图1所示,提取多个look-direction增强信号,通过注意层映射成单通道输入特征,再发送到单通道唤醒网络层。与单路唤醒相比,只增加了一层网络,既保证了唤醒性能,又大大减少了计算量。
图1:基于多波束特征融合[1]的唤醒模型
对于上述基于波束形成的[1]多音唤醒,前端信号处理(波束形成)和唤醒模块没有进行联合调谐。为此,本文提出了一种基于神经网络的多音语音增强模型。该模型读取单通道的频谱特征和多通道的相位差特征。同时,根据预设的视觉方向,分别提取出相应的方向特征。这些方向性特征表征了每个时频点是否被特定音调方向的源信号所占据,从而驱动网络在输出端增强最靠近每个音调方向的扬声器。为了避免多音增强模型对目标说话人进行处理后,由于发声区域和说话人的空间分布造成的失真,实验中使用一个原始的麦克风信号,与多方向增强输出的信号一起进行特征融合,通过注意机制发送给唤醒模型。由于前端增强是经过神经网络处理的,因此可以将该多音增强模型和唤醒模型联合优化,实现真正的前后一体化多音唤醒。完整的模型结构如图2所示。
图2:提出的基于神经网络的多语音区域语音增强和唤醒模型[2]
图3显示了一个多音增强的示例。两个扬声器分别位于图(a)所示位置,麦克风同时采集的两个语音信号频谱如图(b)所示。作者设置了4个增强方向(0度、90度、180度、270度)。多音增强模式会对蓝色音箱在0度和90度方向上进行增强,对黑色音箱在180度和270度方向上进行增强。四个方向的增强语音谱如图(c)所示。
图3:多音增强网络输出示例
在图4中,作者将基于神经网络的多波段增强唤醒模型与基于波束形成的多波段增强唤醒模型和基线单通道唤醒模型进行了比较。可以看出,本文提出的方法明显优于其他方法,特别是在信干比小于6dB的声环境下。在连续12小时干扰噪声下,将假唤醒控制在1次的条件下,进行不同方法的唤醒率测试。
图4:多音唤醒模型的性能比较
0
多音语音增强模型与声纹模型相结合,形成多音说话人验证,提高声纹系统在复杂远场声环境中的鲁棒性。在未来,这项工作可以与其他语音任务结合起来,比如语音识别。
本文主要介绍了关于为啥手机siri谁都可以喊出来(揭秘Siri语音唤醒原理)的相关养殖或种植技术,栏目还介绍了该行业生产经营方式及经营管理,关注发展动向,注重系统性、科学性、实用性和先进性,内容全面新颖、重点突出、通俗易懂,全面给您讲解技术怎么管理的要点,是您致富的点金石。
以上文章来自互联网,不代表本人立场,如需删除,请注明该网址:http://23.234.50.4:8411/article/1534095.html