从“金耳朵”到 AI:基于小波散射的工业设备与小电机异响检测方法
摘要:传统的工业听音质检全靠老师傅的“金耳朵”,效率低、难复制且无法 24 小时在线。本文深度解读一篇发表于 Engineering Applications of Artificial Intelligence (EAAI) 的前沿论文。该研究并未采用常规的频谱分析,而是另辟蹊径,利用小波散射变换 (WST) 配合 自编码器特征图重构,像给机器做“声学 CT”一样,在大型潮汐涡轮叶片测试中实现了 99.5% 的惊人检出率 。苏州东原电子推出的 👉异音异响(Anomalous Sound Detection)检测系统👈 ,基于先进的机器听觉与无监督/弱监督学习算法,能够在无需大量故障样本的情况下,自动学习“正常声音模型”,并实时识别偏离正常状态的异常声学特征,实现对设备运行状态的持续监测与早期预警。
1. 痛点:为什么工厂里全是“苦行僧”?
在工业监测领域,尤其是像 FastBlade 这样的大型潮汐涡轮叶片疲劳测试设施中,挑战是史诗级的 。
想象一下,一个长达 10 米的巨型复合材料叶片,要在液压作动器的驱动下,日夜不休地进行数百万次的弯曲疲劳测试 。
- 无人值守的刚需:测试可能持续数周,让人类工程师 24 小时盯着是不可能的,且高压液压系统存在安全隐患 。
- 听音辨位的难度:虽然麦克风很便宜,但在嘈杂的工业环境下(液压泵声、电机声、环境噪音混杂),想要从轰鸣声中听出微弱的机械故障(如作动器异步、系统共振、螺栓微松动),难度堪比“大海捞针” 。
传统方法的“体温计”困境:为什么良品也被误杀?
以前的机器检测(如 PCA 或标准自编码器)通常只看频响曲线或简单的重构误差(MSE) 。这就好比医生只给你量体温。
- 体温正常≠没病:很多隐疾(如早期裂纹)根本不会引起整体声学能量的剧烈变化 。
- 核心难题:类内差异 (Intraclass Variability) :这是本研究揭示的最大痛点。工业现场的“正常声音”并不是一成不变的。系统预热时、不同负载下、甚至润滑油温度变化,都会导致“正常声音”千差万别 。
如果用传统的“阈值法”,你会发现良品和次品的误差分布严重重叠。你想抓次品,就会误杀良品;你想放过良品,就会漏掉次品。

图注:传统方法的至暗时刻。基于 PCA 和 CAE 重构误差的直方图显示,良品(蓝色)和异常品(红色)的误差数据像两座纠缠的大山,严重重叠。这意味着无论你把报警阈值设在哪里,模型要么是“瞎子”(漏检),要么是“疯子”(误报) 。
2. “AI 老师傅”的黑科技修炼手册:从失败中诞生的神技
为了解决“良品声音千变万化”的难题,研究团队打出了一套独特的“组合拳”,彻底终结了这种“玄学”检测时代。
黑科技一:超越频谱图的“声学 CT” —— 小波散射变换 (WST)
普通的 AI 听声音喜欢用 短时傅里叶变换(STFT) ,但这玩意儿有个物理学上的死穴:海森堡测不准原理。
- STFT 的尴尬:你想要看清频率(高频分辨率),就看不清时间(时间分辨率低),反之亦然。对于工业噪音中稍纵即逝的“咔哒”声,STFT 往往会把它们模糊成一团雾 。
本文采用了一种数学上的降维打击——小波散射变换 (Wavelet Scattering Transform, WST) 。
它是如何工作的?
WST 不仅仅是做卷积,它引入了模运算(Modulus) 和平均池化(Averaging) 的迭代过程。
- 平移不变性:不管故障声发生在第 1 秒还是第 10 秒,WST 提取的特征都是稳定的 。
- 形变稳定性:即使机器转速有轻微波动(声音频率微变),WST 依然能识别出这是同一个故障 。
- 多尺度透视:它就像一把多尺度的梳子,通过多层散射网络,既能抓住高频的瞬态冲击(如断裂声),又能稳住低频的周期性轰鸣 。

图注:声学“CT”扫描对比。
- 最下面一行 (e) 是普通的 STFT,对于异常信号(Anomaly 1),图像模糊不清,特征淹没在背景中。 * 上面两行 (a, b) 是 WST(小波散射) 。请注意 Anomaly 1 中部的亮斑,异常信号的纹理清晰可见,边缘锐利。这就像给声音开了 4K 高清画质,让 AI 能“看”清声音的每一个毛孔 。
黑科技二:透视“机器大脑”的潜意识 —— 隐藏层特征图 (Feature Maps)
这是本研究最精彩的“反转”部分。
最初,研究人员训练了一个 2D 卷积自编码器 (CAE) ,试图用“输入 vs 输出”的重构误差来检测异常。
结果惨败。因为 CAE 能力太强了,它不仅学会了还原正常声音,连异常声音也还原得惟妙惟肖!导致异常样本的重构误差很小,根本检测不出来 。
绝处逢生:不看结果,看过程
研究人员决定不再看输出端,而是直接把手术刀伸进了神经网络的内部隐藏层 。 他们发现:虽然 CAE 能勉强还原异常图像,但在中间层的特征图 (Feature Maps) 里,模型已经“困惑”了。
- 正常样本:激活了特定的水平纹理特征(代表稳定的周期信号)。
- 异常样本:激活的特征图杂乱无章,或者缺失了某些关键纹理 。

图注:AI 的“脑电图” 。
这是模型第 2 层卷积层提取出的特征图。
- 左边(良品) :特征图呈现出清晰、规则的水平条纹。
- 右边(异常品) :特征图变得模糊、断裂或出现不规则斑块。 AI 的“眼睛”其实已经敏锐地捕捉到了两者在纹理特征上的细微差异,只是被最终的输出掩盖了 。
核心算法:互相关性 (NCC)
为了量化这种差异,论文放弃了 MSE,改用 归一化互相关 (Normalized Cross-Correlation, NCC) 。 AI 会拿当前声音的特征图,去和“标准良品”的平均特征图做对比。
- 气质相符 (NCC 高) :通过。
- 气质不符 (NCC 低) :哪怕误差再小,只要特征图的“纹理”对不上,立刻报警 。
黑科技三:工业级的实战部署
这套系统不是实验室里的玩具,它是为了像 FastBlade 这样的大型设施设计的 。 研究人员搭建了一套完整的端到端流水线:
- 传感器:使用廉价的 MEMS 数字麦克风(成本低,抗干扰强) 。
- 算力:利用 NVIDIA GPU 加速 WST 的计算,将复杂的数学变换时间压缩到毫秒级 。
- 流程:麦克风采集 -> GPU 进行 WST 变换 -> CAE 提取特征 -> 计算 NCC -> 分类器判断。

3. 实战战绩:快、准、狠
这位“AI 老师傅”上岗后的表现只能用“残暴”来形容。它在处理 类内差异巨大 的数据集时,表现出了惊人的统治力。
极速:毫秒级响应
在 NVIDIA RTX A6000 GPU 的加持下,处理一个 0.5 秒的音频样本:
- 特征提取 (WST) :约 0.09 秒。
- 模型推理 (CAE + NCC) :约 0.02 秒。
- 总耗时:约 0.2 秒 。 这完全满足实时监测的需求(测试循环通常较长),意味着故障刚一出现,系统就能在下一个循环前发出警报。
精准:99.58% 的准确率
在测试集上,结合 KNN 分类器(k=5)和 2D 特征图数据:
- 总体准确率:99.58% 。
- 召回率 (Recall) :良品召回率 100%,异常品召回率 92%。这意味着它极少误报,且绝大部分故障都能被抓住 。
鲁棒:什么都能听
无论是 随机的敲击声(模拟外部干扰),还是 系统异步运行的怪声(模拟作动器故障),甚至是 系统启动时的变频声,都逃不过它的耳朵 。相比之下,传统方法对这些非稳态信号束手无策。
4. 总结与启示
这项发表于 EAAI 的研究给工业 AI 落地上了生动的一课:
- 不要迷信端到端:有时候,传统的信号处理智慧(如小波变换 WST)能给深度学习提供更好的“食材” 。
- 打开黑盒看一看:当模型的输出结果不理想时,不妨看看中间层的特征图,那里可能藏着被忽略的真相 。
- 低成本也能做大事:不需要昂贵的振动传感器或高速摄像机,一个几十块钱的 MEMS 麦克风 + 精心设计的算法,就能让工业质检从“玄学”变成“科学” 。
如果你也是被“异音检测”折磨的工程师,面对嘈杂环境和微弱故障束手无策,那么这个融合了 前沿时频分析 (WST) 与 自监督特征学习 (CAE) 的创新框架,绝对值得你参考一试!


苏州东原电子有限公司推出的 谛听异音检测系统 正是该先进理念的工程化实践与应用典范。系统深度融合了智能声学分析与机器学习算法,将论文中的前沿方法转化为稳定、可复制的工业解决方案,实现了对设备异音的24小时在线、高精度、自动化检测,助力企业告别依赖人工听音的传统模式,迈向智能化预测性维护的新阶段。
