智能语音技术中麦克风阵列的原理

2018-07-09 03:57:02 网络整理阅读：84 评论：0

麦克风阵列(Microphone Array)，从字面上，指的是麦克风的排列。也就是说由一定数目的声学传感器(一般是麦克风)组成，用来对声场的空间特性进行采样并处理的系统。

智能语音技术中麦克风阵列的原理

早在20世纪70、80年代，麦克风阵列已经被应用于语音信号处理的研究中，进入90年代以来，基于麦克风阵列的语音信号处理算法逐渐成为一个新的研究热点。而到了“声控时代”，这项技术的重要性显得尤为突出。

麦克风阵列能干什么?

任何一项技术的发生发展都伴随着问题的提出及解决，麦克风阵列也是如此。那么它主要应用在哪些场景下呢?又有着怎样的功能!

噪声环境怎么破?— 语音增强

语音增强是指当语音信号被各种各样的噪声(包括语音)干扰甚至淹没后，从含噪声的语音信号中提取出纯净语音的过程。所以DingDong在嘈杂环境下，也能准确识别语音指令。

通过麦克风阵列波束形成进行语音增强示意图

从20世纪60年代开始，Boll等研究者先后提出了针对使用一个麦克风的语音增强技术，称为单通道语音增强。因为它使用的麦克风个数最少，并且充分考虑到了语音谱和噪声谱的特性，使得这些方法在某些场景下也具有较好的噪声抑制效果，并因其方法简单、易于实现的特点广泛应用于现有语音通信系统与消费电子系统中。

但是，在复杂的声学环境下，噪声总是来自于四面八方，且其与语音信号在时间和频谱上常常是相互交叠的，再加上回波和混响的影响，利用单麦克风捕捉相对纯净的语音是非常困难的。而麦克风阵列融合了语音信号的空时信息，可以同时提取声源并抑制噪声。

目前科大讯飞已经实现了基于线性阵列、平面阵列以及空间立体阵列的波束形成和降噪技术，效果均达到业界一流水平。