克服传统视觉监控局限:基于机器学习驱动的突发性异音检测架构
在传统交通监控中,视频分析往往难以识别轮胎打滑、车辆碰撞等关键危险信号,尤其在夜间、遮挡或复杂光照环境下存在明显盲区。针对这一问题,本文基于机器学习提出了一种面向道路场景的音频异常检测架构,通过引入词袋模型(BoW)与多特征融合方法,实现对突发性冲击声与持续性摩擦声的高精度识别。
结合我司机器听觉异音检测系统,该类算法可直接部署于工业现场或智能监控设备中,实现对车辆异响、电机异常、结构冲击等多类声学事件的实时监测与定位。系统具备高识别率、强抗噪能力及低算力运行优势,可广泛应用于智慧交通、汽车制造、设备预测性维护等领域。
一、 引言与研究背景
在智能交通系统(ITS)和公共安全领域,道路交通监控系统对于快速响应交通事故、降低事故死亡率具有极其重要的意义。研究表明,缩短事故发生至救援队伍调派之间的时间,可使死亡率显著降低约 6%。传统上,这类监控任务高度依赖于视频分析技术,通过摄像头追踪车辆轨迹、识别违规行为或检测交通拥堵。
然而,在许多复杂的现实场景中,纯视觉信息的可靠性存在显著局限。例如,轮胎在路面上剧烈摩擦打滑(Tire skidding)通常是危险路况或事故的前兆,但这种极具辨识度的声学特征完全无法被视频流捕捉。此外,当异常事件发生在摄像头的视野盲区、或者遭遇夜间及恶劣照明条件时,视觉监控系统往往会彻底失效。
为此,本文作者提出了一种基于音频流分析的道路事故检测新方法,重点用于识别轮胎打滑和车辆碰撞(Car crashes)等危险声音。在当今多数IP监控摄像头已内置麦克风的硬件基础上,音频监控不受光照影响,能够作为视觉系统的完美补充,极大提升安防系统的整体感知能力与反应速度。
二、 核心挑战与应对逻辑
在开放式道路环境中进行音频事件检测面临两大核心挑战:
- 极低的信噪比(SNR): 目标异常声音往往被严重的交通背景噪声(如持续的车流声)所淹没,特别是在繁忙的高速公路上。
- 事件持续时间的极端差异: 车辆碰撞通常是瞬态的“脉冲型(Impulsive)”声音,持续时间极短;而轮胎打滑则是“持续型(Sustained)”声音,可能长达数秒。
为了同时克服这两种挑战,本文并未采用传统的全局静态特征提取,而是创新性地引入了自然语言处理和图像识别领域的词袋模型(Bag-of-Words, BoW),构建了一个能够同时兼顾短期频率剧变与长期统计特征的“双层音频表征架构”。
三、 核心方法与模型架构剖析
该音频异常检测系统的工作流被严密划分为四个层级:低层特征提取、字典学习、高层向量表征与最终分类。
1. 低层特征提取 (Low-Level Features Extraction)
音频信号在几毫秒内即可发生剧烈变化。为了捕捉这种短时变异性,系统将连续的音频流切分为 32 毫秒(32 ms,对应 1024 个 PCM 采样点)的短时数据帧,且相邻两帧之间设置 75% 的重叠,以保证声学分析的连续性。
在特征选择上,研究团队对比测试了三种主流的低层声学特征集:
- 梅尔频率倒谱系数(MFCC): 广泛用于语音识别,具有较好的抗噪潜力。
- Bark子带能量比(Bark sub-bands): 基于人耳听觉心理学模型的频带划分。
- 时空与频谱综合特征: 包含零交叉率、频谱质心、信号能量等经典特征。
2. 字典学习 (Dictionary Learning)
由于低层特征空间是连续且无限的,无法直接进行模式统计。系统采用 K-means 聚类算法对训练集中的低层特征向量进行聚类,提取出 K 个聚类中心点。这 K 个中心点构成了系统的“基础声音单元字典(Dictionary of basic audio words)”。这使得无限的声学信号被离散化为有限的声学“词汇”。
3. 高层词袋表征 (High-Level Representation)
在获得字典后,对于音频流中的任意一个低层特征向量,系统计算其与字典中各个“音频词”的欧式距离,并将其归类为距离最近的词。随后,在设定的长时间窗口(例如 3 秒的时间窗,步长 1 秒)内,系统统计各个“音频词”出现的频次,从而生成一个高维的直方图(Histogram)向量。
这一设计的巧妙之处在于:它允许系统自动学习哪些短时声学特征在大时间尺度上构成了区分异常与背景噪声的关键标志,从而完美兼容了碰撞(突发高频词)与打滑(特定频段词持续出现)两种截然不同的声学事件。

Construction of the high-level representation. For each vector vi the nearest audio word uj in the dictionary is determined (b). Then, the occurrencecounts of the single audio words are stored in a histogram, whose bins are hj(j=1,…,K) that constitutes the high-level vector (c). In the example, vectors v1 and v2 have u2 as the nearest audio word in the dictionary. Thus, the second bin of the histogram has a value equal to 2. In the same way, audio word u3 has onlyone close vector, resulting in a value equal to 1 for the third bin of the histogram. Audio words u1 and u4 , instead, have no occurrences.
4. SVM分类器架构 (Classification Architecture)
系统采用了一组 M+1 个线性核支持向量机(SVM)并行工作。其中 M 为关注的异常事件类别数(本文为2),额外的 1 个分类器专门用于识别背景噪声(Background sound)。每个 SVM 在测试阶段会输出一个置信度得分,系统根据得分是否超过特定阈值(本文设为 0)来判定最终分类。引入专门的背景分类器极大地增强了系统对复杂交通噪声的鲁棒性。

Architecture of the classifier. The scores of the SVM classifiers arecombined in order to determine the final class to be assigned to the inputvector H.
四、 系统部署的声学衰减建模
本文的一个重大工程应用亮点在于,作者并未将研究局限于纯算法层面,而是基于严谨的声学物理模型,对麦克风阵列在真实道路上的最佳部署间距进行了深度仿真评估。

A sketch of the deployment of the proposed system: a set R of microphones is located at a distance of m meters far from each other and ata height hr . An event of interest can be recognized at a maximum distance of d meters from the closest microphone.
系统能否检测到事件,取决于到达麦克风时的信噪比:SNR=Ls(d)−Ln。
- 异常声音的衰减 Ls(d): 作者遵循了ISO 9613-2 标准,将声音在空气中的衰减分解为几何发散衰减(随距离倍增下降6dB)、大气吸收衰减(受温湿度及频率影响)、地面效应衰减以及障碍物屏障衰减。
- 交通背景噪声 Ln: 引入了经典的CoRTN(Calculation of Road Traffic Noise)模型,将道路网格化,根据车辆的行驶速度、重型车辆比例、车流量及道路坡度,精准计算出基础交通噪声水平。
仿真结论指出: 假设系统能够可靠识别信噪比为 10 dB 的异常声音,在低速低流量的乡村道路(Country road,约 50 km/h,<100 辆/小时)场景下,麦克风的最远有效感知距离约为 120 米,此时麦克风阵列的部署间距可达 240 米。然而,在车辆高速且密集的繁忙高速公路(Highway,约100 km/h,4000辆/小时)上,环境底噪急剧攀升,麦克风的最佳部署间距应被大幅压缩至 50 米左右。这一模型为智慧城市的硬件铺设提供了宝贵的理论依据。
五、 实验设计与主要结论
由于业界缺乏标准的道路监控音频数据集,研究团队独立构建并开源了一个具有极高测试难度的数据集。该数据集通过线性叠加的方式,将真实的车辆碰撞、轮胎打滑音频,按照设定的信噪比( 15 dB )混入到多达 23 种不同的真实道路背景噪声中,生成了包含交叉验证 Fold 的庞大验证集。
通过严密的对比实验,研究得出了以下核心结论:
- 极高的识别准确率与特征差异: 在设定字典规模 K=64 的最佳泛化状态下,系统整体达到了优秀的识别精度。其中,使用课题组早期提出的时空/能量特征达到了最高的 82%识别率,MFCC 特征达到了 80.25%。在 ROC 曲线下面积(AUC)评估中,MFCC 的 AUC 值高达 0.90,展现出极佳的综合分类效能。
- 不同特征对距离衰减的敏感性: 论文通过人为将测试集信号衰减 -3 dB 和 -6 dB 来模拟距离变远的情况。实验深刻揭示了特征的物理属性对鲁棒性的影响:基于能量和信号强度的低层特征在声音变弱时性能会灾难性滑坡,因为其能量阈值被背景底噪轻易掩盖;相反,基于频率域分析的 MFCC 和 Bark 特征由于抓取的是声学成分的分布比例,对信号强度的衰减表现出极强的鲁棒性,信噪比的下降并未导致其识别率的严重下跌。
- 计算轻量化与工业落地潜力: 本文算法的复杂度极低,在处理 32 kHz 采样率的音频流时,仅占用单核 Intel i5 处理器约 3% 的计算资源。此外,该算法已被成功移植并实时运行于廉价的 STM32F4 嵌入式微控制器上。这意味着该系统可以在不增加高昂计算成本的前提下,直接集成于现有的智能监控摄像头硬件内。
六、 研究总结与启示
总体而言,这篇文献为公共交通音频监控领域树立了一个从底层特征工程到高层物理部署的标杆。该研究突破性地利用词袋模型(BoW)成功统筹了“极短脉冲声(碰撞)”与“长时拖尾声(打滑)”的特征提取难题。更重要的是,通过对 ISO 声学传播衰减规范和 CoRTN 交通噪声模型的引入,系统地回答了“AI模型在真实物理世界中应如何部署”这一关键工程问题。
其高识别率、强抗噪能力与极低硬件算力需求的结合,预示着该方法在未来构建“视听融合”的全天候、无盲区智能交通安防网络中,具有广阔的商业应用前景与学术延伸价值。
👉 点击了解完整解决方案与实际应用案例,查看系统如何实现复杂环境下的高精度异音检测。
P. Foggia, N. Petkov, A. Saggese, N. Strisciuglio, and M. Vento, “Audio Surveillance of Roads: A System for Detecting Anomalous Sounds,” IEEE Transactions on Intelligent Transportation Systems, vol. 17, no. 1, pp. 279-289, Jan. 2016.
