基于仿生机器听觉的工业异音检测:用深度学习复现工程师的“听诊”绝活
在工业 4.0 与智能制造持续推进的今天,设备预测性维护早已不再局限于温度、振动与压力等传统维度。苏州东原电子有限公司 深耕工业声学传感与边缘计算领域,全新推出的 👉异音异响在线检测系统👈,正是基于仿生机器听觉与深度学习算法,将资深工程师的“听诊”经验转化为可量化的数字模型。无论是发动机总成台架测试、铁路轴承走行部巡检,还是家电产线NVH质检,东原电子以非接触、高灵敏的声学特征识别技术,赋予生产线一双永不疲劳的“AI耳朵”,让微小异响无处遁形,助力制造企业实现从事后维修到智能预警的质控升级。
一、 引言与研究背景
在真实的工程测试与工业现场(如铁路缺陷巡检、汽车发动机检测等)中,经验丰富的工业工程师通常能够通过“听诊”机器在运行过程中发出的不同声音来辨别设备的健康与故障状态。近年来,随着传感器与计算技术的长足发展,声学信号与温度、压力等传统测量手段一样,被越来越广泛地应用于工业故障诊断领域。例如,声学分析已被用于自行车轮辋的无损评估、柴油发动机燃烧特性的识别以及石化行业往复式压缩机的监控等。
然而,尽管音频信号处理技术在音乐、语音识别、自然语言翻译和智能手机应用等领域取得了爆炸式的发展,但其在工程工业诊断领域的潜力尚未被充分挖掘。为此,作者提出了一种极具前瞻性的“机器听觉(Machine Hearing)”框架。该研究从生物学角度出发,旨在通过模仿人类听觉系统的信号处理机制,并结合现代深度机器学习技术,构建一个能够自动识别机械故障的智能声学诊断模型。
二、 传统声频分析的局限与核心科学启发
在传统的数字信号处理中,声谱图(Spectrogram)是最常用的时频分析技术。它基于短时傅里叶变换(STFT),将时间序列分解为较小的片段,并对每个时间窗口内的信号应用傅里叶变换进行频率分析。
然而,传统声谱图存在一个根本性的缺陷:它在时域和频域上都呈现固定的分辨率,导致所有的频带宽度恒定不变。而在实际的工业环境中,大多数机器发出的声音在较低频段包含极其密集的成分,而在较高频段包含的信息较少。因此,能够在不同尺度上进行多分辨率的时频分析显得更为合理。
这一痛点在生理学中找到了完美的解决方案。研究表明,人类的听觉系统在提取和简化音频信号特征方面具备非凡的能力。人类听觉的起点是声波(空气压力),它经过外耳和耳道,最终进入内耳中一个至关重要的复杂骨骼结构——耳蜗(Cochlea)。耳蜗内充满液体,其中包含基底膜(Basilar membrane)。随着声压进入,基底膜产生振动;其巧妙的物理结构在于:基底膜在其基部(Base)较硬,而在其顶部(Apex)较柔韧。这种结构导致基底膜的不同区域会对不同频率的声音产生共振——基部响应高频,顶部响应低频。
基于上述生物学启示,本文的核心研究动机即是:开发一个简化的仿生人类听觉模型(人工耳蜗提取特征 + 人工神经网络模拟大脑处理),以更加符合生物学原理的方式解决复杂的工业诊断问题。


Schematic of the human ear and the location of the cochlea; (b) Schematic of the uncoiled cochlea with the basilar membrane responding to high frequency at the base and low frequency at the apex.
三、 核心方法与机器听觉系统架构
该机器听觉系统的工作流被严密划分为两大部分:模拟耳蜗的特征提取阶段,以及模拟中枢神经系统的深度序列学习阶段。
1. 仿生特征工程:耳蜗图 (Cochleagram)
由于耳蜗内的基底膜本质上可以被建模为一系列重叠的带通滤波器,系统舍弃了具有固定分辨率的传统 STFT 声谱图,转而采用一种名为耳蜗图(Cochleagram)的频谱表示方法。 耳蜗图是通过一组伽马通滤波器(Gammatone filters)生成的。这些滤波器是根据人类听觉神经纤维的脉冲响应测量结果推导而来的,能够极其逼真地近似耳蜗的滤波特性。在具体实现上,系统应用了一个包含 128 个滤波器的滤波器组,其中心频率分布在 50 Hz 到 8 kHz 之间。尤为关键的是,这些频率并非线性分布,而是均匀分布在 ERB(等效矩形带宽)非线性尺度上,使得高频对应更宽的带宽,而低频拥有极高的分辨率。
通过这种处理生成的时间-频率矩阵响应(即耳蜗图),在低频段提供了更精细的特征解析,极大地契合了机械故障信号低频信息密集的物理现实。实验直观对比显示,对于健康与严重磨损的轴承信号,耳蜗图在视觉与特征区分度上均显著优于传统声谱图。
2. 模拟大脑皮层的长短期记忆循环神经网络 (RNN-LSTM)
一旦耳蜗完成了将声压转化为电脉冲的工作,这些信号就会被送往大脑听觉皮层进行处理。在人工模型中,提取出的耳蜗图被作为输入特征,喂入深度人工神经网络(ANN)中进行模式识别。
与处理静态视觉图像的卷积神经网络(CNN)不同,声音本质上是一种时间序列信号,包含着极强的前后依赖关系。因此,人类大脑作为一个动态系统,是通过随时间改变其状态来处理输入序列的。为了赋予模型这种“时间记忆”能力,作者选用并构建了循环神经网络(Recurrent Neural Network, RNN)。
具体而言,该网络架构包含了两个长短期记忆(LSTM)层。LSTM 层通过其内部的门控机制(Gate mechanism)——包括决定遗忘多少历史信息的遗忘门(Forget gate)、更新当前状态的输入门(Input gate)以及控制输出的输出门(Output gate)——能够有效地在前向传播中携带并学习时间序列中的长短期历史特征。
四、 实验设计与主要结论
为了验证该机器听觉方案的工程可行性,研究团队使用 GUNT PT500 机械故障诊断系统,针对旋转机械的核心部件——滚动轴承(Roller bearing)进行了详尽的分类实验。
1. 实验设置与数据集构建
实验环境包含一台电动机、旋转轴、张紧带以及待测轴承,系统转速设定为 1000 rpm,皮带负载为 70 N。音频采集设备使用了一款常见的消费级数字录音笔,放置于距离轴承 25 厘米处,采样率设定为 44.1 kHz。
研究共考察了 6 种不同的轴承状态:
- A:健康轴承 (Healthy bearing)
- B:外圈损伤 (Damage to outer race)
- C:内圈损伤 (Damage to inner race)
- D:滚动体损伤 (Damage to roller element)
- E:综合损伤 (Combined damage)
- F:严重磨损轴承 (Heavily worn bearing)
每种状态采集了 80 秒的独立音频信号,截取其中的 60 秒用于模型训练;在不同的时间段,利用相同的设备独立采集了另外 60 秒的信号作为纯测试集。在送入网络前,音频被切片为 1 秒时长的样本,并转换为 128 维度的耳蜗图。

Experimental setup of the machinery fault diagnostic system[21], the location of the studied roller bearing and the position of the digital recorder; (b) Six bearing conditions studied: A – healthy bearing, B -damage to outer race, C – damage to inner race, D – damage to roller element, E – combined damage to outer, inner race and roller element, and F – heavily worn bearing, each with damages highlighted in red.
2. 核心实验结论
网络采用了 Adam 优化器及交叉熵损失函数进行迭代。实验结果展示了该生物启发模型的强大威力:
- 极快的收敛速度: 训练过程显示,经过仅仅 12 个 Epochs(等效 96 次迭代)的训练,RNN 网络的训练准确率便达到了完美的 100%。
- 出色的泛化与分类精度: 在完全独立的测试集上,该系统取得了 94.7% 的整体分类准确率。
- 零漏报的健康预警能力: 混淆矩阵(Confusion Matrix)深度分析表明,各种带有特定缺陷的故障轴承(B至E)均能被高度准确地分类。最值得工业界关注的是,在仅考虑“健康”与“故障”这两个宏观类别的区分时,系统成功识别了所有的故障情况,没有发生任何一次漏报(No missed alarms)。极少数的误判仅发生在“健康轴承”被误认为是“内圈损伤”,研究推测这可能是由于作为控制组的健康轴承本身存在一定的物理瑕疵或声学数据收集方法造成的误差。
五、 研究亮点与未来展望
本文通过构建一个由耳蜗图和 RNN-LSTM 组成的机器听觉流水线,成功提供了基于声学生物启发的机械故障诊断的概念证明(Proof of concept)。其最大亮点在于突破了传统的信号分析范式,利用了更加贴近人类真实听觉机制的非线性滤波与序列记忆能力来进行智能判定。
同时,作者以极其严谨的学术态度指出了当前阶段在迈向完全工业落地时所面临的局限性:
首先,真实的工业环境并不像实验室那样干净,它充斥着来自不同振源的强烈背景噪声。这也是当前声学诊断尚未完全取代接触式振动传感器的重要原因。因此,未来的研究必须将重点放在前端音频的预处理与降噪(Preprocessing/denoising)算法上。 其次,未来的验证工作应引入变转速、变负载下的复合故障检测,以进一步增强该深度类脑模型的鲁棒性。最终愿景是打造一个具有高度泛化能力的人工智能听诊系统,能够广泛服务于航空、汽车、船舶、铁路以及高端制造等多个核心工业领域的设备状态监测。
Y. Zhang and M. Martínez-García, “Machine Hearing for Industrial Fault Diagnosis,” in 2020 16th IEEE International Conference on Automation Science and Engineering (CASE), 2020, pp. 849-854.
