基于谱时信息融合的异常声音检测:打破单一特征能力的“天花板”
在复杂工业声学检测场景中,单一声学特征往往难以全面刻画设备运行状态,尤其是在多噪声叠加、工况变化频繁的环境下,传统检测方法容易出现误判或漏检。苏州东原电子提出的 👉ASD特征融合异音检测技术👈,通过融合时域、频域以及多维声学特征信息,构建更完整、更稳定的声音表征模型,使系统能够从“多角度理解声音”,而不仅仅依赖单一指标判断异常。该方案结合机器听觉与智能算法优势,显著提升对微弱异常、早期故障及复杂工况下声音变化的识别能力,实现更高鲁棒性与更强泛化性能,为电机、轴承、风扇及各类工业设备提供更可靠的智能声学质检与状态监测能力。
论文信息:
- 标题:Anomalous Sound Detection Using Spectral-Temporal Information Fusion
- 作者:Youde Liu, Jian Guan, Qiaoxi Zhu, Wenwu Wang
- 机构:哈尔滨工程大学、悉尼科技大学、萨里大学
在工业设备的预测性维护中,通过声音来判断机器是否健康(即异常声音检测,Anomalous Sound Detection, ASD)是一项极具落地价值的技术。然而,在真实的工业场景下,收集设备在所有可能故障状态下的声音数据几乎是不可能的。因此,目前主流的算法多采用无监督或自监督学习的方式:仅利用正常状态下的声音数据进行训练,让模型学会“什么是正常”,在实际运行时,只要声音特征偏离了“正常”的分布,就被判定为异常。
然而,在这个过程中,算法工程师们常常会遇到一个棘手的现象:即使是同一种类型、同一批次出厂的设备,模型在它们身上的检测效果也高度不一致。有的设备稍有异响模型就能敏锐捕捉,有的设备哪怕故障明显,模型也无动于衷。这种检测性能的不一致与不稳定性,成为了阻碍异常声音检测技术在通用场景中大规模落地的瓶颈。
本篇论文敏锐地捕捉到了这一痛点。研究团队没有选择在复杂的模型结构中继续“内卷”,而是退回到了信号的起点——输入特征的表征方式,并提出了一种基于谱时信息融合(Spectral-Temporal fusion, STgram)的自监督方法。该方法不仅大幅提升了整体的检测准确率,更重要的是,它极大地改善了模型在个体机器上的检测下限,为工业听诊器的稳定性提供了新的解法。
一、 为什么同类机器的检测表现会天差地别?
传统的异常声音检测系统,无论是基于自编码器(Autoencoder, AE)通过重构误差来判断异常,还是基于元数据(如机器ID)的自监督分类方法,在输入特征的选择上,绝大多数都采用了 log-Mel 频谱图(log-Mel spectrogram)。
log-Mel 频谱图是基于人类听觉感知特性设计的。它通过梅尔滤波器组(Mel-filter bank)将线性的频率刻度映射到梅尔刻度上,从而在低频区保留了较高的分辨率,在高频区进行了压缩与平滑。这种特征在语音识别等任务中表现优异,但在异常声音检测中,却暴露出了固有的缺陷。
工业设备的异常声音往往隐藏在极细微的瞬态变化或高频分量中。 例如,轴承表面的轻微剥落,或者齿轮啮合时的瞬间冲击,其声学特征可能是一个极短促的高频脉冲。当使用基于人类听觉的 log-Mel 频谱图时,这些高频的、瞬态的细微异常特征极易在滤波器组的平滑过程中被无意间“滤除”或模糊掉。
由于模型能够接收到的特征从一开始就是不完整的,这就导致在面对那些依赖高频瞬态特征来区分正常与异常的特定机器个体时,模型变得“耳聋”。未能全面区分正常与异常声音,最终导致了检测性能在不同机器个体之间出现了剧烈的波动。
二、 论文做法:谱时融合(STgram)补全异常特征拼图
为了打破这层天花板,论文提出:既然频谱图会丢失瞬态与高频信息,那么就需要从原始的波形信号中,直接提取未被破坏的时域特征来进行补偿。这正是谱时融合特征(STgram)的核心思想。
论文构建了一个双支路的特征提取与融合框架(如图 1 所示):

1. 频域分支:log-Mel 频谱图
这一分支沿用传统方法,通过短时傅里叶变换(STFT)并应用梅尔滤波器组,提取出维度为 M×N 的对数梅尔频谱图(M 为频带数,N 为时间帧数)。这部分特征为模型提供了宏观的频率分布基底。
2. 时域分支:TgramNet 特征提取
这是论文设计的关键。为了从一维的原始波形直接提取时域特征(Tgram),研究人员设计了一个名为 TgramNet 的轻量级一维卷积神经网络。
TgramNet 的设计极其巧妙地对齐了时频特征的物理意义与维度结构:
- 首层卷积对齐 STFT:网络第一层采用了一维大卷积核。为了保证提取出的时域特征在时间分辨率上与频谱图完全一致,该层的卷积核大小严格设定为 STFT 的窗口大小,步长设定为 STFT 的跳步长度。同时,输出的通道数被设定为梅尔频带的数量 M。
- 后续局部特征强化:在首层之后,网络串联了三个 CNN 块(包含层归一化、LeakyReLU 激活函数和小卷积核),这些块在不改变特征维度的情况下,进一步提取并强化波形信号中的局部瞬变结构。
经过 TgramNet,原始波形被转换为一个维度同样是 M×N 的时域特征图(Tgram)。
3. 谱时融合与自监督学习
由于频域特征和时域特征在维度上被完美对齐,系统只需使用简单的特征拼接(Concatenation)操作,即可将两者融合为谱时特征 STgram。
随后,这个融合了互补信息的特征图被送入基线分类网络 MobileFaceNet(MFN)中。为了让模型学到的正常声音特征表征更加紧凑,论文舍弃了传统的交叉熵损失函数,引入了人脸识别领域著名的 ArcFace 损失函数。ArcFace 能够强制扩大不同机器类别之间的特征距离,同时缩小同一机器正常样本之间的类内距离,从而显著提高模型对异常分布偏离的敏感度。
三、 实验说明了什么:补齐“短板”,全面提升
论文在声学界著名的 DCASE 2020 挑战赛任务 2 的数据集上对该方法进行了全面验证。该数据集包含了风扇(Fan)、水泵(Pump)、滑轨(Slider)、阀门(Valve)、玩具车(ToyCar)和玩具传送带(ToyConveyor)等多种设备的运行声音。
1. 个体下限(mAUC)的大幅跨越
在工业应用中,客户往往并不那么在意系统的平均准确率有多高,而更在意系统表现最差的那台设备有多糟糕。系统在同类不同编号设备中的最差表现,由最小 AUC(minimum AUC, mAUC)指标来衡量。
实验结果令人振奋:相较于之前文献中最先进的方法(Glow_Aff,一种基于流模型的自监督方法),STgram-MFN 方法在 mAUC 指标上实现了跨越式的提升。具体而言,在四种真实的工业机器上:
- 风扇(Fan) 的最差个体性能从不到 50% 提升到了 81.39%(提升 31.79 个百分点)。
- 水泵(Pump) 的最差个体性能提升到了 83.48%(提升 17.78 个百分点)。
- 阀门(Valve) 的提升同样高达 21.13 个百分点。
整体而言,六类机器的平均 mAUC 从 Glow_Aff 的 70.32% 大幅跃升至 84.86%。这一数据强有力地证明了,融合时域信息使得模型真正拥有了捕获各类细微异常的能力,从而极大地平抑了同类不同机器之间的性能波动。
2. 为什么一定需要特征融合?
为了更直观地解释谱时特征的有效性,论文补充了详实的消融实验(见图 2的 t-SNE 可视化聚类)。

从可视化图表可以清晰地看出两者的互补关系:对于机器“ID 01”(被红圈标注的部分),如果仅使用 log-Mel 频谱图(左图),正常样本(黑点)与异常样本(红叉)大量重叠,模型根本无法区分。这意味着这台特定机器的异常特征恰好在计算频谱图时丢失了。然而,在单独使用时域特征 Tgram 的可视化结果(右图)中,同一台机器的正常和异常样本被非常清晰地分开了。
但同时,论文也诚实地指出,如果只使用时域特征,由于波形信号中往往掺杂大量无关的环境噪声,整体检测性能(AUC)反而会有所下降。正是宏观频率分布(Sgram)与微观波形结构(Tgram)的互相补位,才铸就了该系统优异且稳定的表现。
四、 对行业的意味着什么:工程落地视角延伸
这篇论文虽然是一项学术探索,但它为当前 工业声学监测、电机异音检测以及机械故障诊断 的工程落地提供了极具价值的指导。
在许多工业异常检测的项目实践中,算法工程师往往容易陷入“模型焦虑”,花费大量精力去尝试各种最新的 Transformer 或扩散模型架构,却在特征提取环节草草套用开源库中的 MFCC 或 log-Mel 频谱图。当模型在某一条特定产线上发生严重的漏报时,解决手段往往是疯狂堆叠数据。
这项研究提醒我们:特征的物理边界往往决定了模型的认知上限。
对于像工业设备这种声学成分复杂、异常特征极具偶发性的场景,基于人类发音和听觉机理设计的声学特征虽然成熟,但不一定完全契合“机器语言”。
在设计工业级声音异常检测系统时:
- 多元信息互补是必经之路:不应单纯依赖单一视角的特征表征。不仅可以融合宏观的频谱与微观的时域,还可以结合多传感器融合(如振动信号结合声学信号),利用不同维度的物理信息构建对设备健康状态的立体刻画。
- 网络结构设计的物理直觉:该论文在设计一维卷积 TgramNet 时,将卷积核与步长参数与短时傅里叶变换严格绑定的做法,展示了算法设计与物理信号处理原理深度结合的威力。这种“知其然更知其所以然”的工程处理手段,能够以极低的算力代价,换取极其稳定的模型表现。
- 重新审视“最差表现”:在推进声学诊断系统进入真实产线时,相比于拿来宣传的“整体准确率”,开发团队更应将系统的验收指标锚定在类似 mAUC 这样的“木桶短板”上。一个在99台设备上准确率达 99%,却在1台设备上完全失灵的系统,往往会被制造企业视作不可靠的系统。
总而言之,通过引入并融合时域特征来补偿传统频谱图中丢失的瞬态异常信息,本文为异常声音检测技术走向通用化、稳定化提供了一条扎实的破局路径。未来,基于类似思路的表征学习方法,有望使 AI “听诊器”更加敏锐可靠,真正在复杂的工业现场中发挥出预测性维护的巨大经济价值。
从工程落地的角度来看,异常声音检测不仅依赖先进算法,更需要稳定的声学采集与成熟的工业应用经验。针对复杂生产环境中设备声音特征多变、异常信号微弱等问题,苏州东原电子推出的 谛听异音检测系统 通过专业声学传感与智能分析算法相结合,可对设备运行声音进行持续监测与特征分析,在早期阶段发现潜在异常。系统特别适用于电机噪声检测、设备声学检测以及各类工业异音异响检测场景,能够在保证检测灵敏度的同时提升识别稳定性,为企业提供可靠的早期预警和品控优化方案,成为工业场景中的必备利器。
🤝我们能为您提供的支持🤝






