异常声音检测与分类系统(ASD):监控场景中的实现方法

翻译自《AN ABNORMAL SOUND DETECTION AND CLASSIFICATION SYSTEM FOR SURVEILLANCE APPLICATIONS》作者:Cheung-Fat Chan and Eric W.M. Yu 2010.8.23 ^^

我们团队最近在攻坚几个复杂的 NVH异音异响检测项目,在查阅大量机器听觉底层文献时,重温了这篇经典的基于声学信号的异常检测研究。虽然这篇文章的原始背景是针对银行抢劫等安防场景下的人声尖叫与环境突发异常声音(如玻璃破碎、爆炸)的监测,但其底层的特征工程提取逻辑与状态机分类思想,对于我们今天在制造业推进的电机异音异响、电动牙刷异音异响检测等工业落地项目,依然有着极为直接的工程指导意义。

【为什么工业现场需要声学异常检测】

在传统的工厂自动化监控中,视觉检测占据了半壁江山。但在某些特殊情况下,比如设备内部的机械结构封闭区域,或者光线受限的暗箱测试环境,视觉系统往往无能为力。这篇文章也敏锐地指出,声学监控在黑暗和摄像隐私受限的狭小区域具有得天独厚的优势。对于工业产线而言,产品的内部缺陷往往首先通过声音和振动暴露出来。例如在 小电机异音异响检测 中,转子扫膛、轴承滚珠破损或碳刷摩擦不均,这些缺陷在外观视觉上完全不可见,但却会实实在在地向外辐射出特异性的高频碰撞或摩擦声学信号。这就是机器听觉系统在工业界不可替代的核心原因。

【传统方法在实际工程中遇到的困难】

在真实的工厂车间里,背景噪声极其复杂且动态多变。文章中在评估系统时,特意在不同的信噪比(SNR)条件下进行了测试,因为真实的录音往往混合了各种环境背景噪声。在工业现场,如果我们仅仅使用简单的音量阈值法(比如整体分贝超过限值就报警),必然会被产线上气缸排气、行车移动等无规律的突发噪声严重干扰。此外,由于遗漏关键的异常事件会带来高昂的代价,监控系统通常宁愿容忍一定的误报率,也决不能接受过高的漏报率。这一痛点在我们的 轮毂电机异音异响检测 产线上表现得尤为明显:宁可提高一定比例的误杀率让人工介入复检,也绝不能让带有异响瑕疵的电机流向整车装配厂。

【这篇论文提出了什么新思路】

为了解决复杂背景下的异常识别问题,这篇研究采用了一种多级漏斗式的分类系统架构。系统首先包含一个特征提取模块,然后通过第一级分类器将输入声音严格划分为人类声音或非人类的突发异常声音。如果判定为人声,再进入下一级判断是否为极端的尖叫;如果是环境音,则进一步分类为诸如枪声、玻璃碎裂等紧急事件或仅仅是汽车刹车等非紧急事件。这种分层排查的逻辑极其契合工业界的做法。我们在实际产线开发算法时,也是先建立一个稳健的“良品背景噪声模型”,先将明显不符合良品特征的信号剥离出来,然后再通过更细致的分类器去诊断到底是齿轮打齿还是轴承异音。

Fig. 1:系统逻辑架构图 (The Proposed Sound Detection and Classification System)

【关键方法的工程化理解】

这套系统的核心在于其精心构建的声学特征提取工程。文章明确指出,为识别各种声音提取合适的声学特征是至关重要的,虽然文献中有极多的特征可选,但全部使用会导致极高的计算代价。 因此,作者开发了一组非常实用且低算力消耗的特征组合。首先是加权平均差分能量。这个特征的巧妙之处在于,它在各种背景噪声水平下能保持相对较小和连贯平滑,但一旦遇到突发的异常声学事件,其数值就会发生显著的突变。这对于捕捉工业生产中产品内部零件干涉摩擦发出的脆响极为有效。其计算逻辑如下:

使用MathJax渲染数学公式
\[ \Delta_{E}(n)=1.5\sqrt{\frac{1}{M(0.4+v_{n})}(\sum_{m=0}^{M-1}\delta_{n-m})} \]

其次是线性预测编码(LPC)频谱平坦度和快速傅里叶变换(FFT)频谱平坦度。这两个特征用于衡量声音在频域上的能量分布是像白噪声那样均匀,还是集中在某些特定的共振峰上。紧接着是极具工业参考价值的“谐波性”特征。文章采用频域基音分析方法来计算声音的谐波属性。在我们的中置电机异音异响检测项目中,电机正常运转时发出的电磁音往往具有极强的阶次谐波特性,而一旦发生刮擦异音,这种原本规律的谐波结构就会被打破。除了上述特征,系统还利用了过零率、中位电平交叉率以及峰谷计数率。尤其是中位电平交叉率,它通过设定一个当前信号块最大值 60% 的交叉线,来精准捕获瞬态的高频冲击信号。当一个样本比其相邻的两个样本至少高5倍或低5倍时,就会被识别为强峰或强谷。这极其适合捕捉机械部件表面微小物理缺陷导致的异常撞击声。在算法模型方面,系统主要依赖隐马尔可夫模型(HMM)。文章针对人类声音、非人类突发声音以及清洁和嘈杂环境下的背景声音分别训练了独立的三组模型。通过一个 100 帧宽度的滑动窗口,算法在时间轴上持续评估当前帧信号属于哪种状态的概率。

【对工业异音检测与状态监测的启发】

为了适应不同使用场景的实际噪音条件,系统还开发了灵敏度控制逻辑,针对10dB以下、10到20dB之间以及20dB以上等三种不同的信噪比范围,推导出了不同的判定阈值。这种可根据现场信噪比动态切换灵敏度集合的设计,是工程落地的典范。算法工程师做声学异常检测,往往喜欢直接把音频转成时频图然后扔进庞大的深度学习视觉网络中。但在工业现场的边缘计算节点上,算力和内存非常有限。这篇文章所展示的,仅仅利用峰谷计数、频谱平坦度等基础信号处理特征的组合,配合一个轻量级的概率状态机,就能在30dB到10dB的典型信噪比环境下将平均分类错误率压低至9.1%。在展示的成功分类案例中,时间波形、频谱图和声学特征被直观地呈现出来,并且精准标记了起点和终点。这启示我们在做工业声学检测时,应当更加注重提取能够反映机械物理本质的特征参量,而不是纯粹依赖黑盒模型的数据暴力拟合。

Fig. 2:声学特征与时频谱对比图 (Demonstration of Successful Classification)

【对实际落地的价值与局限】

这套体系的工程价值在于它的模块化和高稳健性。作者巧妙地利用持续计算的背景模型概率作为基准,构建了一套结合能量突变和置信度差值的动态判定规则。然而,在实际落地中我们也要看到其局限性。论文中的异常事件大多是枪声、玻璃碎裂等声学特征极其突出的“强脉冲”信号。而在真实的制造流水线上,很多微小的电机疵点异音往往会被淹没在主轴运转或测试夹具的巨大轰鸣声中。这类微弱异常信号不仅信噪比极低,而且其声学表现和良品的正常波动边界非常模糊。这就要求我们在沿用这套时域峰谷和频域谐波特征体系的基础上,必须进一步引入阶次跟踪技术和更高级的自适应降噪算法,才能真正解决现代制造业对极致良率的追求。总而言之,无论是安防领域的异常声音监测,还是NVH异音异响检测,其技术本质都是在混沌的噪声海洋中寻找那极其微小的确定性特征信号。

类似文章

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注