网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备

机器之心专栏
网易云信音频实验室 网易云信音频实验室自主研发了一个针对瞬态噪声的轻量级网络音频降噪算法(网易云信 AI 音频降噪) , 对于 Non-stationary Noise 和 Transient Noise 都有很好的降噪量 , 并且控制了语音信号的损伤程度 , 保证了语音的质量和理解度 。
基于信号处理的传统音频降噪算法对于 Stationary Noise(平稳噪声)有比较好的降噪效果 。但是对于 Non-stationary Noise(非平稳噪声) , 特别是 Transient Noise(突发噪声)降噪效果较差 , 而且有些方法对于语音也有较大的损伤 。随着深度学习在 CV(Computer Vision)上的广泛应用 , 基于神经网络的音频降噪算法大量涌现 , 这些算法很好的弥补了传统算法对于 Non-stationary Noise 降噪效果不好的问题 , 在 Transient Noise 上也有较大的提升 。
但是 , 基于神经网络的音频降噪在计算复杂度上存在挑战 。虽然我们生活中的终端设备的计算能力在不断提升 , 比如个人笔记本、手机等 , 但是大模型的深度学习算法 , 很难在绝大部分设备(特别是不含 GPU 的设备)上运行 。目前也有一些开源的、基于神经网络的低开销降噪算法[1,2,3] , 能够在大部分终端设备上达到实时运行的标准 。但是这些算法的运算量对于 RTC(实时通信)的 SDK 依然太大 , 其原因是 SDK 中包含了大量算法 , 每个子算法的开销都必须严格把控 , 才能保证整个 SDK 的运算开销在一个合理范围 , 并且能够在大部分终端设备上运行 。
针对上述挑战 , 网易云信音频实验室自主研发了一个针对瞬态噪声的轻量级网络音频降噪算法(网易云信 AI 音频降噪) , 对于 Non-stationary Noise 和 Transient Noise 都有很好的降噪量 , 并且控制了语音信号的损伤程度 , 保证了语音的质量和理解度 。与此同时 , 云信的 AI 音频降噪将计算开销控制在一个非常低的量级 , 达到了和传统算法接近的计算量 , 比如 MMSE [4] 。目前 , 网易云信的 AI 音频降噪已经成功落地在其自研的新一代音视频技术架构(NERTC)中 , 在大幅提升降噪效果的同时 , 也在大多数终端机型上成功应用 , 包括了大部分中低端机型 。
本文介绍的内容 , 即网易云信音频实验室发表于 INTER-NOISE 2021 的《A Neural Network Based Noise Suppression Method for Transient Noise Control with Low-Complexity Computation》一文 , 本篇文章详细介绍了在基于深度学习的音频降噪算法中 , 如何在低计算开销的情况下 , 实现对不同噪声 , 包括 Transient Noise 的抑制 。
方法
在介绍算法细节之前 , 我们需要先在数学上来构建一下问题模型 。在公式(1)中 , x (n) 、s (n) 、和 d (n)分别代表带噪信号、干净语音信号和噪声信号 。
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
带噪信号x (n)代表麦克风在实际场景中所收集的信号 , 其中n代表时域采样点 。我们对公式(1)做一个 STFT(短时傅里叶变化)得到(2) ,
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
其中
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
分别代表x (n) 、s (n)和 d (n)的频域信号 , i代表第
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备
文章图片

文章图片
时域帧 , k代表频点 。由此我们可以得出公式(3) ,
网易云信神经网络音频降噪算法:提升瞬态噪声抑制效果,适合移动端设备