解锁通用声源分离:听觉启发的滤波器如何增强人工智能的“听力”

摘要:

声音场景分析是声学信号处理领域的核心挑战之一,而 声源分离 作为其关键环节,旨在从混合信号中分离出目标声源。近年来,基于深度学习的端到端时域方法,特别是采用编码器-分离器-解码器框架的模型,在语音分离任务中取得了显著成功 。然而,将这种成功扩展到分离任意类型声音(即通用声源分离)仍然面临诸多挑战,部分原因在于声音来源的多样性和复杂性远超纯净语音 。Han Li 等人发表于 ICASSP 的论文《Auditory Filterbanks Benefit Universal Sound Source Separation》 深入探讨了编码器中滤波器组设计的关键作用,特别是借鉴人类听觉系统特性的滤波器组对通用声源分离任务的益处。

引言:

在真实的声学环境中,目标声音往往与各种干扰声(如其他说话人、背景噪音、音乐等)混合在一起。如何有效分离这些混合信号,对于语音增强、自动语音识别、助听器设计、音乐信息检索等诸多应用具有重要意义。近年来,随着深度学习的迅猛发展,端到端的时域声源分离方法应运而生,并迅速成为研究热点。与传统频域方法不同,时域方法直接在原始波形上进行处理,避免了频域中相位估计的困难及将幅度谱和相位谱分开处理可能带来的信息损失。其中,编码器-分离器-解码器框架被广泛采用, 具体框架为:

  1. 编码器 (Encoder): 第一个阶段通过一组滤波器(滤波器组)与原始混合信号进行卷积,将时域混合变换成中间表示。
  2. 分离器 (Separator): 这个步骤的核心组件通常是一个复杂的神经网络,其在特征表示空间中估计每个声源对应的掩码(Mask)或直接估计分离后的声源表示 。
  3. 解码器 (Decoder): 这一阶段,解码器使用估计出的掩码和另一个滤波器组来重构分离后声源的时域波形。

因此,编码器中滤波器组的设计是决定系统性能的关键环节之一,滤波器组的选择直接影响了信号的表示能力和后续分离任务的难易程度。目前主要有三类滤波器组设计策略 :

固定滤波器组(Fixed Filterbanks):使用预先定义好的滤波器,如短时傅里叶变换(STFT) 、常 Q 变换(CQT)、或基于听觉模型的滤波器组(如Gammatone、Mel 滤波器)。这类滤波器计算相对简单且不易过拟合。但它们的固定特性可能无法最优地匹配特定任务和数据的需求。
自由(学习)滤波器组(Free/Learned Filterbanks):滤波器的特性完全在网络训练过程中从数据中学习得到 。这种方式赋予模型最大的灵活性,理论上可以学习到最适合任务的表示。然而,完全自由的学习可能导致参数量巨大,训练不稳定,且学习到的滤波器缺乏明确的物理解释,尤其在处理包含大量类噪声源的通用分离任务时可能遇到困难 。
参数化滤波器组(Parameterized Filterbanks):这类滤波器组基于特定的数学函数族(如 Sinc 滤波器或听觉滤波器),但其关键参数(如中心频率或带宽)是在训练中学习的 。这在引入先验知识和结构的同时,仍允许模型进行适应。

人类听觉系统展现出在复杂声学环境中高效分离和理解声音的卓越能力 。听觉系统对声音的初步处理发生在耳蜗,其基底膜具有频率选择性,不同位置对不同频率的声音产生最大响应,类似于一个滤波器组。模拟耳蜗的模型通常使用 Gammatone 滤波器组 (GTFB) ,它通过特定的数学形式(伽马形状的包络调制一个纯音)模拟基底膜的频率选择性 。其变种 Gammachirp 滤波器组 (GCFB) 则增加了频率调制项,以更好地模拟听觉滤波器形状的不对称性 。

图1 人耳听觉结构图
图2 耳蜗横截面结构图

Li 等人的这项研究正是在上述背景下展开,旨在通过引入参数化的听觉滤波器组来提升通用声源分离性能。

创新点:
  1. 提出参数化的听觉滤波器组:文章提出了将参数化的 Gammatone 滤波器组 (Param-GTFB) 和 Gammachirp 滤波器组 (Param-GCFB) 应用于通用的端到端声源分离任务中,在训练过程中学习最佳参数(如 GTFB 的滤波器阶数 ‘p’、带宽 ‘b’、中心频率 ‘fc’、相位 ‘Φ’,以及 GCFB 的 chirp 参数 ‘c’)。
  2. 揭示网络学习到的分离机制:通过模拟经典的听觉组织实验(交替呈现不同频率间隔和时间间隔的纯音),文章探究了神经网络学习到的分离机制 。研究发现,无论使用哪种滤波器组,模型都倾向于学习类似人类听觉的、基于频率和时间邻近性的通用格式塔原则 (Gestalt principle) 来进行分离,而不是为每一类声源单独建模 。
  3. 系统性比较不同类型的滤波器组:该工作在统一的编码器-分离器-解码器框架下,对自由学习、参数化(包括 Sinc、GTFB、GCFB)以及固定(包括 STFT、GTFB、GCFB、多尺度 GTFB)等多种滤波器组在通用声源分离任务上的性能和特性进行了系统的比较和分析 。
滤波器组性能测试:实验设置

为了比较不同滤波器组方法(固定的、自由学习的以及本文提出的参数化听觉滤波器组)的性能,研究人员创建了一个具有挑战性的 USSS 数据集。

  • 数据集: 他们将环境声音(来自 BBC Sound Effects 的车辆声、铃声、动物叫声等 )、语音(来自 LibriSpeech )和纯器乐(来自 MUSAN )按等比例混合 。从不同类别或特定声源中随机选择两个 3 秒长的片段 ,以 -5 到 +5 dB 的随机信噪比混合 ,创建了 45,000 个用于训练、验证和测试的混合音频片段 。所有音频都被标准化为 16 kHz 采样率 。
  • 模型: 他们使用了 Conv-TasNet 架构 ,其中分离器为 TDCN 。在不同实验中,仅改变编码器的滤波器组类型 。解码器的滤波器组始终是自由学习的 。
图1不同滤波器组的频率响应。(a) 自由学习的滤波器组,(b) 带有学习参数的参数化 GTFB(Gammatone 滤波器组),(c) 固定的 GTFB。红色虚线表示从线性频率 f 到 ERB 尺度 FERB(f) 的映射关系。
图2 中心频率 fc=1.125 kHz 时,具有多种包络参数 {p,b} 的四个参数化 Gammatone 滤波器的频率响应

这项工作表明,基于人类听觉的结构和原理是构建更强大、更通用的 AI 听觉系统的一条有效途径。让机器不仅学习识别声音内容,更要掌握声音分组和分离的基本法则。