网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备( 二 )


文章图片

文章图片
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
代表估计出的语音信号 ,
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
表示估计出的 Gain 大小 。至此 , 我们的降噪问题就是需要去估计出一个准确的
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片

特征表示
为了要实现低计算量的目的 , 我们需要最大限度的去压缩模型大小 , 这样必然导致在同等状况下 , 压缩后模型的表现会更差 。为了弥补模型变小后带来的效果下降 , 该研究从输入特征(Input Feature)入手 , 选择更能代表语音特性的特征 , 从而去区分语音和噪声 。当然特征大小(Feature Size)也需要严格控制 , 共同保证低计算量的要求 。现在开源的单通道深度学习降噪算法中 , 比较普遍的 Feature 是用信号的 Magnitude 和 Phase , 或者直接用频域信号的 Complex Value 。这样的做法好处是可以保证模型能获得所有的频域信息 , 没有任何信息丢失;但是缺点是这些频域信息对于语音信号和噪声信号的分离度不够 , 而且输入的参数量偏大 。方法 [1] 中用到了 Pitch Correlation(基音相关性) ,
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
表示求信号的相关性 ,
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
表示 Pitch Correlation 。Pitch Correlation 能够突出语音信号的特性 , 能在噪声中将语音信号分离出来 。Pitch Correlation 在平稳噪声上有着很好的表现 , 但是一旦出现非平稳噪声 , 由于 Pitch Correlation 只包含帧内信息 , 这时候就无法区分分平稳噪声和语音了 。还有一种情况 , 当 SNR(信噪比)比较小时 , 时域的自相关性受噪声影响大 , 容易导致其判断不准 , 从而产生误差 。针对以上问题 , 我们提出了谐波帧间互相关性(Harmonic-Correlation) ,
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
其中
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
之前
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
帧的 Magnitude 。对于
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
该研究分两步来讨论它的优势 。首先 , 对频域 Magnitude(
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
)做自相关(Auto-Correlation)可以突出谐波特性(类似于 Spectral Sharpening 或者 Reverse Whitening) , 对于语音信号中的谐波特性 , 可以更容易的凸显出来 。其次 , 把自相关换成和前
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备