尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

(论文速读)ARdiff:一种无监督频率注意振动信号去噪的自适应逆步扩散框架

(论文速读)ARdiff:一种无监督频率注意振动信号去噪的自适应逆步扩散框架 论文题目ARDiff: An adaptive reverse-step diffusion framework for unsupervised vibration signal denoising with frequency attention一种无监督频率注意振动信号去噪的自适应逆步扩散框架期刊Mechanical Systems and Signal Processing摘要提出了一种自适应逆步扩散框架ARDIFF用于高噪声工业环境下振动信号的无监督去噪。与依赖固定去噪轨迹或外部条件输入的传统扩散模型不同Ardiff通过集成三个关键组件无需任何类别标签或指导即可实现自适应噪声感知重建。首先频率注意模块(FAM)在频域中引入了复值注意机制使该模型能够有效地捕获对信号重构至关重要的真实故障相关频谱特征。其次噪声步长预测模型(NSPM)根据输入噪声水平估计最优逆扩散时间步长提高了重建精度。第三基于方差的尺度方法(VSM)将输入信号的尺度与扩散模型在预测时间步长的期望分布对齐确保稳定一致的恢复。使用开源CWRU数据集、实验HAI-PUMP数据集和SNU行星齿轮箱数据集进行的实验验证表明Ardiff的去噪性能始终优于现有的去噪模型尤其是在极低的信噪比(SNR)条件下。消融研究证实了FAM、NSPM和VSM的单独贡献验证了ARdiff是一个健壮且可通用的去噪框架能够在没有任何外部条件或标签监督的情况下有效运行。此外ARdiff在高斯和非高斯噪声条件下都保持了稳定的去噪性能突出了其在现实工业环境中的实用稳健性。一、研究背景与论文要解决的问题1.1 工业振动信号为什么需要去噪旋转机械中的轴承、齿轮等部件一旦发生故障往往会在振动信号中产生周期冲击、摩擦变化、不平衡以及调制等现象这些变化不仅会体现在时域波形中也会在频域中形成与故障相关的特征频率、边带和谐波。因此振动信号一直是轴承和齿轮故障检测、状态监测以及预测性维护中的重要信息来源。但是在真实工业环境中传感器采集到的振动信号通常并不干净电磁干扰、内部摩擦、附近机械设备运行以及其他环境扰动都会叠加到原始信号中。当噪声强度较大时真正与故障相关的 defect frequency、sideband 和 modulation component 很容易被淹没进而导致故障特征提取困难、故障识别失败甚至在正常状态下产生误报警。从这个角度看振动信号去噪并不是单纯让波形“看起来更平滑”而是要在降低噪声的同时尽可能保留能够反映机械故障的时间结构和频率结构。如果去噪模型只追求时域误差变小却把故障频率、调制峰或者弱冲击一起抹掉那么对于后续故障诊断来说这种去噪结果反而可能失去意义。1.2 传统方法和现有深度学习方法分别有什么问题传统振动信号去噪方法主要包括 Wavelet TransformWT、Empirical Mode DecompositionEMD和 Singular Spectrum AnalysisSSA等。这些方法通常先在时频域或者分解域中把信号拆成不同成分再通过人为选择频带、模态或者阈值去除噪声。问题在于这类方法往往较依赖专家经验很多参数需要根据具体工况手动设定。复杂噪声环境下一旦频带或阈值设置不合适就有可能把真正与故障相关的频率成分一起删除从而降低后续诊断精度。Autoencoder 类方法通过数据驱动的方式学习从 noisy signal 到 clean signal 的映射能够减少人工规则设计但 Autoencoder 本质上依赖压缩和重构过程细粒度的故障相关频谱特征可能在 latent space 中被削弱甚至丢失。LSTM 和 Transformer 等时序模型能够直接建模时间依赖关系避免完全依赖压缩式表示但它们通常仍然试图一次性完成整条信号重构在强噪声和复杂非线性条件下对细微结构的恢复能力仍然有限。近年来 Diffusion Model 在图像、语音和时序信号恢复中表现出较强能力。与一次性重构不同DDPM 通过逐步估计并去除噪声让信号从高噪声状态逐渐恢复到原始数据分布因此理论上更适合处理严重污染的信号。不过作者指出将现有 conditional diffusion model 直接用于工业振动去噪仍然存在明显问题很多 conditional diffusion 方法会把 degraded signal 本身作为 condition或者把噪声等级、退化类型作为外部条件输入。对于 -8 dB、-12 dB 这样的严重污染信号来说condition 本身就包含大量错误噪声信息模型可能受到误导甚至过度拟合这些噪声从而削弱对真正故障特征的恢复能力。除此之外已有 diffusion denoising 方法大多以时域建模为主但旋转机械中的故障信息往往集中在特定频段尤其是与结构共振、调制和周期冲击相关的频率区域反过来如果只在频域中处理也会忽略整体波形形状、周期性和相位等时域信息。因此论文认为一个真正适合工业振动去噪的 diffusion framework 至少需要同时满足三个要求既能利用时域和频域信息又能根据不同输入噪声强度自适应决定反向扩散过程而且不能依赖严重污染的 noisy observation 作为外部条件。1.3 ARDiff 的整体思路为了解决这些问题作者提出 ARDiff也就是 Adaptive Reverse Diffusion Framework。它没有让所有输入都从 DDPM 的最终 timestep 开始反向扩散而是先估计当前输入的噪声程度再预测一个合适的 reverse diffusion starting timestep随后根据这个 timestep 对真实工业信号进行方差尺度校正最后从对应中间状态开始逐步去噪。同时作者在 U-Net 中加入 Frequency Attention ModuleFAM显式学习故障相关的频率信息使模型在降低噪声的过程中尽量保留关键谱峰和调制结构。从整体上看ARDiff 的三个核心组件分别解决三个不同问题FAM 解决“哪些频率信息应该重点保留”Noise Step Prediction ModelNSPM解决“应该从第几个 reverse step 开始去噪”Variance-based Scaling MethodVSM解决“真实工业信号的幅值和方差尺度如何匹配 diffusion model 训练阶段的中间分布”。三个模块配合以后模型可以在不依赖 class label 和外部 degraded-condition guidance 的情况下对不同噪声强度的振动信号进行自适应恢复。二、DDPM 基础与 ARDiff 为什么要改变反向扩散起点2.1 DDPM 的前向扩散和反向扩散DDPM 的基本思想是先通过 forward diffusion 逐步向 clean signal 中加入 Gaussian noise直到数据接近标准高斯分布再训练一个网络学习反向过程从 noisy state 一步一步恢复原始信号。在第 t 个 forward diffusion step 中经过多步噪声累积以后可以直接写成其中这里() 是 clean signal() 是 Gaussian noise。随着 t 增大() 逐渐减小而 () 逐渐增大因此信号中的原始信息越来越少噪声占比越来越高。反向扩散过程中模型在每一个 timestep 预测当前状态中的噪声 ()再逐步恢复 ()。对于确定性去噪任务论文将 reverse process 中的随机项设置为 0从而利用多步噪声估计得到最终恢复信号。训练阶段主要优化真实加入噪声与模型预测噪声之间的误差论文 Figure 1DDPM 的 forward diffusion 与 reverse diffusion 过程展示 clean signal 逐渐加入噪声以及 U-Net 逐步估计并去除噪声的过程。2.2 为什么普通 DDPM 不适合直接处理真实工业信号标准 DDPM 的 reverse diffusion 通常从最终状态 tT 开始也就是从接近 pure Gaussian noise 的状态逐步恢复。但是现实中的工业振动信号通常只是“被噪声污染”并没有真的经历 DDPM 预先定义的完整 forward diffusion。一个 0 dB 的 noisy signal 和一个 -12 dB 的 noisy signal 显然不应该都被视为 tT 的状态否则模型就会对不同噪声程度的输入执行同样长度的反向扩散。更重要的是真实工业信号可以近似写成其中 () 为 observed industrial signal() 是未知噪声尺度。这个表达式与 DDPM 训练时的 () 分布并不完全相同即使 NSPM 能够判断某个输入大概对应哪个 timestep真实信号的 variance 也不一定与该 timestep 下的训练数据一致。因此 ARDiff 不能只解决“从哪一步开始”的问题还必须解决“输入尺度如何对齐”的问题这也是 VSM 必不可少的原因。论文 Figure 2ARDiff 的整体训练与推理框架。训练阶段使用带 FAM 的 U-Net 学习扩散噪声预测推理阶段先经过 NSPM 预测 reverse timestep再通过 VSM 进行尺度校正最后从预测的中间 timestep 开始反向扩散。三、ARDiff 的核心方法3.1 Frequency Attention Module同时利用时域和频域信息论文首先针对 vibration signal 的频率特性提出 FAM。传统 time-domain attention 可以学习较长范围的时序关系但无法直接强调与故障有关的特定频率区域。对于轴承和齿轮来说真正有诊断价值的信息往往集中在某些 fault frequency、harmonic 或 modulation band因此作者希望 U-Net 在 denoising 时不仅判断“哪个时间位置重要”还能够判断“哪个频率区域重要”。FAM 被插入 U-Net 的 residual block 之后并与原来的 time attention 采用类似的 skip connection。输入时域特征记为经过 FFT 后得到频域表示其中 B 为 batch sizeC 为 channel 数T 为时间长度F 为 frequency bin 数量。作者没有直接在整个频谱上统一做 attention而是把频率划分成 low、mid、high 三个 frequency band每个频带单独计算 attention从而让网络学习不同频率区域之间具有区分度的特征。对于每个 frequency band作者进一步把复数频谱分成 real part 和 imaginary part并使用 1D convolution 生成对应的 Q、K、V这里 ()、()、() 在 real 和 imaginary branch 之间共享。作者之所以保留复数形式是因为 FFT 后的实部和虚部共同决定幅值和相位如果直接只保留 magnitude 或者只使用 real-valued attention可能损失相位关系最终影响 IFFT 之后的时域波形恢复。论文 Figure 3集成 Frequency Attention Module 的 U-Net 整体结构展示 FAM 在不同 U-Net 层级中的插入位置。3.2 Linear Complex Self-Attention在频域中同时建模幅值和相位FAM 内部最关键的部分是本文提出的 Linear Complex Self-AttentionLCA。作者分别对 real 和 imaginary component 进行 attention 计算并按照复数乘法的组合关系构建上下文随后再与 query 交互得到最终 attention value所有 frequency band 和 attention head 的输出沿 channel 方向拼接再经过 1D convolution 和 layer normalization最后把 real 和 imaginary part 重新组合成 complex representation通过 IFFT 返回时域并与原始输入进行 residual connection。这样FAM 的目的不是单独生成一个频谱结果而是在 U-Net 的时域去噪过程中不断注入具有频率选择性的特征使模型能够在恢复波形的同时保留故障相关谱结构。论文 Figure 4Frequency Attention Module 与 Linear Complex Self-Attention 的内部结构包括 FFT、Low/Mid/High 三频带划分、LCA、频带拼接、IFFT 和 residual connection。3.3 Noise Step Prediction Model让反向扩散步数适应输入噪声强度如果所有 noisy signal 都从相同 timestep 开始反向扩散那么 0 dB 和 -12 dB 信号会经历几乎相同的恢复流程这显然不够合理。因此作者设计 NSPM让模型直接从 raw vibration signal 中估计当前噪声程度并输出适合的 reverse diffusion starting timestepNSPM 由多个 1D convolution block 组成每个 block 包括 convolution、batch normalization、ReLU 和 max pooling不同 convolution layer 使用不同 kernel size以便在多个尺度上提取噪声结构。完成 feature extraction 后再通过 fully connected layer 输出一个标量 timestep。噪声越强预测的 (\hat{t}_{pred}) 越接近较大的 diffusion step需要执行更多 reverse steps噪声较弱时预测 timestep 较小可以直接从更接近 clean signal 的中间状态开始恢复。这一设计有两个好处。一方面模型不需要外部输入“当前是 -4 dB 还是 -12 dB”而是自己从 noisy signal 中估计另一方面它避免了标准 DDPM 每次都从 tT 开始恢复能够根据输入噪声程度自适应控制反向扩散长度。论文 Figure 5Noise Step Prediction Model 的结构和参数配置展示不同 1D Conv Block、MaxPool1D、Linear Block 以及最终 predicted diffusion step。3.4 Variance-based Scaling Method解决真实数据和扩散训练数据的尺度不一致仅仅预测 timestep 仍然不够因为真实工业信号 () 的 variance 不一定与 DDPM 在对应 timestep 生成的 () 一致。作者因此提出 VSM根据预测 timestep 对输入进行缩放其中 S 是 scaling factor。首先根据 cosine noise scheduler 和 NSPM 输出的 timestep 获得 ()并定义线性 SNR由真实工业信号可以估计 clean signal variance而 diffusion model 在 timestep t 的理论 variance 为因此 scaling factor 为最终 VSM 将 observed industrial signal 缩放到 diffusion model 在预测 timestep 下更熟悉的统计尺度使后续 reverse diffusion 更稳定。可以把 NSPM 和 VSM 的关系理解成NSPM 先判断“这条信号应该对应 diffusion 的哪一步”VSM 再把它调整成“数值分布也真的像那一步”。论文 Figure 6Variance-based Scaling Method 的原理展示 training data、industrial data 和 scaling factor 之间的尺度对齐过程。四、实验设置4.1 三个振动数据集论文使用三个数据集验证 ARDiff分别是 CWRU Bearing Dataset、HAI-PUMP Bearing Dataset 和 SNU Planetary Gearbox Dataset。CWRU 包括 Normal、Inner race fault、Outer race fault 和 Ball element fault 四种健康状态正常状态采样频率为 48 kHz故障状态为 12 kHzHAI-PUMP 同样包含正常、内圈、外圈和滚动体故障采样频率为 20 kHzSNU Planetary Gearbox 则包含 Normal 和 Planet gear line fault采样频率为 25.6 kHz。所有信号都采用 sliding window 划分为 2048-point 样本每个 health condition 提取 3000 samples。数据按照 training:validation6:1.5:2.5 划分并保证各数据划分之间没有重叠最终通过 Min-Max normalization 将信号缩放到 -11。论文 Figure 7三个实验平台分别为 CWRU test rig、HAI-PUMP test rig 和 SNU Planetary Gearbox test rig。论文 Table 1三个数据集的 load、rotating speed、sampling frequency 和 health states。4.2 对比模型与训练配置论文选择五个现有模型进行对比包括 NL-FCNN、DRCAE、DConformer、AEDM 和 UCDIR。NL-FCNN 和 DRCAE 属于不依赖 class label 的 Autoencoder 类去噪模型DConformer 采用 CNN-Transformer hybrid并联合优化 denoising loss 和 fault classification loss因此属于带监督多任务模型AEDM 和 UCDIR 则属于 conditional diffusion framework都利用 noisy observation 或 condition information 引导恢复。所有模型均使用 PyTorch 2.1.0 和 Python 3.8在 Windows 10、Intel Xeon Gold 5218R CPU 和 NVIDIA RTX A6000 GPU 上运行。对比模型的 learning rate、epoch 和 batch size 根据 validation performance 通过 grid search 调整其中 learning rate 搜索范围为 1e-31e-4epoch 为 200500batch size 为 64512。ARDiff 在三个数据集上统一采用 learning rate1e-3、epoch200、batch size256并使用 learning rate scheduler。主实验在每个数据集上构造 0 dB、-4 dB、-8 dB 和 -12 dB 四个 Gaussian noise 条件评价指标包括 SNR improvement、time-domain RMSE 和 frequency-domain RMSE。这里 SNR 越低代表输入污染越严重因此 -12 dB 是最困难的实验条件。五、三个数据集上的去噪结果5.1 CWRU Bearing DatasetCWRU 上ARDiff 在四个 SNR 条件下都取得最高 SNR improvement并在 time-domain RMSE 上始终保持最优。0 dB、-4 dB、-8 dB、-12 dB 下ARDiff 的 time-domain RMSE 分别为 0.131、0.146、0.178 和 0.208对应的 SNR improvement 分别为 6.467、9.343、11.601 和 14.210 dB。最值得关注的是 -12 dB。此时 ARDiff 的 time-domain RMSE0.208UCDIR0.407AEDM0.387DConformer0.240DRCAE0.289NL-FCNN0.304。与 UCDIR 相比ARDiff 的 time-domain RMSE 约降低 49%与 AEDM 相比约降低 46%。说明当 noisy observation 已经受到严重污染时依赖 degraded condition 的 UCDIR 和 AEDM 性能下降更加明显而不依赖这些 condition 的 ARDiff 反而保持了更稳定的恢复能力。在 frequency-domain RMSE 上ARDiff 并不是每个噪声水平都绝对第一。例如 0 dB 时 AEDM3.941优于 ARDiff 的 4.434但随着噪声增强ARDiff 的优势越来越明显在 -12 dB 时 frequency-domain RMSE6.051而 UCDIR13.932、AEDM12.784、DConformer9.308、DRCAE10.926、NL-FCNN10.532。说明 ARDiff 真正突出的地方不是轻噪声条件下的单点最优而是在 extreme low-SNR 下仍然能够稳定保留频谱结构。论文 Table 2CWRU 数据集在 0、-4、-8、-12 dB 下的 time-domain RMSE、frequency-domain RMSE 和 SNR improvement。在 -8 dB 外圈故障样本上时域结果显示 ARDiff 恢复后的波形更加接近 clean signal并且保留了由故障调制产生的周期结构DRCAE、NL-FCNN 和 DConformer 存在比较明显的 excessive smoothing而 UCDIR 和 AEDM 虽然保留了部分峰值结构但 residual noise 较多。频域中ARDiff 对 25004000 Hz 附近的高能量故障相关成分恢复得更加完整同时减少其他频段中的噪声。论文 Figure 8CWRU 外圈故障 -8 dB 条件下各模型的时域去噪波形对比。论文 Figure 9CWRU 外圈故障 -8 dB 条件下各模型的频域去噪结果对比。作者还专门展示了 -12 dB 下 ARDiff 的 progressive reverse diffusion。该样本预测起始 timestep 为 (\hat{t}830)。在 t830 时时域信号仍然被强噪声覆盖envelope spectrum 中 BPFO harmonic 基本无法辨认随着 reverse diffusion 进行到 t600、t400噪声逐渐降低BPFO 相关峰开始显现到 t200 和 t0 时波形结构和 BPFO harmonic 都得到较清晰恢复。这说明 ARDiff 的反向过程不是一次性把信号“压平”而是在不同 step 中先抑制 broadband noise再逐渐恢复 fault-relevant component。论文 Figure 10CWRU 外圈故障 -12 dB 下从预测 timestep 830 到 t0 的渐进式恢复过程第一行为时域第二行为 envelope spectrum。5.2 HAI-PUMP Bearing DatasetHAI-PUMP 上也表现出类似趋势。ARDiff 在 0、-4、-8、-12 dB 下的 time-domain RMSE 分别为 0.138、0.151、0.176 和 0.215对应 SNR improvement 为 6.406、9.629、12.159 和 14.198 dB。-12 dB 时UCDIR 的 time-domain RMSE0.413AEDM0.372而 ARDiff0.215分别约降低 48% 和 42%。频域方面在 0 dB 和 -4 dB 时 AEDM 的 frequency-domain RMSE 比 ARDiff 更低但随着噪声增强ARDiff 开始表现出更明显优势。-12 dB 时ARDiff7.293而 UCDIR14.233、AEDM11.699、DConformer9.625、DRCAE9.145、NL-FCNN8.709。这个结果再次说明 conditional diffusion 在 condition 本身严重污染时会出现明显退化而 ARDiff 依靠 NSPM、VSM 和 FAM 的组合在不同噪声强度下保持了更稳定的恢复性能。论文 Table 3HAI-PUMP 数据集在不同 SNR 条件下的去噪指标。在 -8 dB 外圈故障样本上ARDiff 不仅恢复了主要时域峰值也更好地保留了高幅值峰附近的 modulation pattern频域中ARDiff 对 10002000 Hz 以及约 5000 Hz 附近的关键高能量频率成分恢复更准确而部分对比模型要么过度平滑导致故障频带被削弱要么留下较多 residual noise。论文 Figure 11HAI-PUMP 外圈故障 -8 dB 条件下的时域去噪结果。论文 Figure 12HAI-PUMP 外圈故障 -8 dB 条件下的频域去噪结果。HAI-PUMP 的 progressive reverse diffusion 从 (\hat{t}828) 开始。在 t828 时 BPFO harmonic 几乎不可见t600 时主要表现为噪声能量下降t400 到 t200 时周期冲击和 BPFO harmonic 开始逐步恢复到 t0 时可以清楚看到最终故障结构。论文 Figure 13HAI-PUMP 外圈故障 -12 dB 下的渐进式反向扩散恢复过程。5.3 SNU Planetary Gearbox Dataset为了验证模型是否只适用于轴承作者进一步在 SNU Planetary Gearbox 上测试 planet gear line fault。ARDiff 在 0、-4、-8、-12 dB 下的 time-domain RMSE 分别为 0.149、0.152、0.168 和 0.199对应 SNR improvement 为 5.265、9.081、12.28 和 14.880 dB。-12 dB 时ARDiff 的 time-domain RMSE0.199而 UCDIR0.496、AEDM0.395、DConformer0.246、DRCAE0.260、NL-FCNN0.298。frequency-domain RMSE 则为 6.335明显低于 UCDIR 的 16.787、AEDM 的 11.269、DConformer 的 9.567、DRCAE 的 9.582 和 NL-FCNN 的 9.864。除了 0 dB 的 frequency-domain RMSE 之外ARDiff 在大部分指标上都取得最优而且随着噪声增强优势更加明显。论文 Table 4SNU Planetary Gearbox 数据集在不同 SNR 下的去噪结果。在 -8 dB planet gear line fault 中ARDiff 不仅恢复了 gear-mesh interaction 引起的周期 modulation pattern还成功保留了中间区域由 line fault 引起的明显故障峰。DConformer、DRCAE 和 NL-FCNN 更容易出现同时去掉噪声和故障信息的问题而 UCDIR 和 AEDM 虽然保留部分结构但 residual noise 仍然较强。论文 Figure 14SNU Planetary Gearbox 的 planet gear line fault 在 -8 dB 下的时域去噪结果。论文 Figure 15同一条件下的频域 spectrum 对比。-12 dB progressive restoration 中作者同时展示时域波形、envelope spectrum、局部 gear-mesh 周期结构以及 06000 Hz 的频谱。随着 reverse diffusion 进行rotational frequency (f_R) 和 gear mesh frequency (f_{Mesh}) 及其 harmonic 被逐步保留而 broadband noise 被持续压制说明 ARDiff 不仅适用于 bearing fault也能够处理 gearbox signal 中更加复杂的调制结构。论文 Figure 16SNU Planetary Gearbox -12 dB 下的 progressive restoration包括时域、包络谱、局部 mesh pattern 和 06000 Hz 频谱。六、NSPM 与三个核心模块的进一步分析6.1 NSPM 能不能准确预测 reverse diffusion timestepNSPM 的 ground truth timestep 根据 cosine noise schedule 和对应噪声注入比例得到。在 T1000 的 diffusion range 中-12、-8、-4、0 dB 对应 ground truth 分别为 832、741、616 和 465。CWRU 上四个条件的 MAE 分别为 26.420、22.724、27.283 和 24.148HAI-PUMP 上分别为 28.302、26.861、25.334 和 26.009。即使在 -12 dB 下CWRU 和 HAI-PUMP 的 MAE 也只有 26.4 和 28.3 左右整体误差控制在完整 diffusion range 的约 3% 以内。论文 Table 5NSPM 在不同 SNR 条件下的 timestep prediction MAE。论文 Figure 17CWRU 和 HAI-PUMP 上 NSPM timestep prediction 的 box plot。作者还对 NSPM 的 prediction error 做了 sensitivity analysis在 -12 dB 条件下人为把预测 timestep 改成 -40%、-20%、20% 和 40%。CWRU 使用正常 predicted timestep 时time RMSE0.208、frequency RMSE6.051、SNR improvement14.210 dB如果低估 20%对应结果为 0.213、6.303 和 14.191 dB几乎没有明显下降但是如果高估 40%则变成 0.253、6.837 和 12.401 dB。HAI-PUMP 也表现出同样规律正常 predicted timestep 的 SNR improvement14.198 dB低估 20% 仍然有 14.154 dB而高估 40% 时下降到 10.933 dB。作者认为原因在于reverse diffusion 前期主要负责去除 broadband noise因此 timestep 适当低估时虽然可能留下少量 residual noise但故障相关结构仍然能够恢复相反如果严重高估模型会把信号当成比实际更加严重的 diffusion state可能损失 phase、amplitude甚至生成原始信号中不存在的 artificial component。论文 Table 6NSPM 在 -12 dB 下的 timestep error sensitivity analysis。6.2 FAM、NSPM 和 VSM 各自贡献了什么作者在 CWRU 上使用 0、-6、-12 dB 进行模块消融。完整的 FAMNSPMVSM 在 -12 dB 时达到 time-domain RMSE0.208、frequency-domain RMSE6.051、SNR improvement14.210 dB。去掉 FAM仅保留 NSPMVSM 后-12 dB frequency-domain RMSE 从 6.051 增加到 7.729说明显式频率注意力对细粒度 spectral restoration 很重要。去掉 VSM仅保留 FAMNSPM 后time-domain RMSE 增加到 0.355SNR improvement 从 14.210 降至 9.149 dB说明即使 timestep 预测正确如果真实输入与 diffusion state 的 variance scale 不一致reverse process 仍然会明显不稳定。如果 NSPM 和 VSM 都去掉只保留 FAM相当于 reverse diffusion 又接近标准 DDPM 的固定起点行为此时 -12 dB 的 time RMSE0.416、frequency RMSE13.114、SNR improvement7.494 dB。完全没有三个模块的 baseline DDPM 则进一步变成 0.421、13.301 和 7.402 dB。因此三个组件并不是重复功能FAM 主要提高 spectral fidelityNSPM 负责 adaptive timestepVSM 负责 amplitude/variance alignment三者组合后才形成完整 ARDiff。论文 Table 7CWRU 上 FAM、NSPM、VSM 不同组合的 ablation result。6.3 为什么作者一定要使用 Complex-valued FAM论文进一步比较 complex-valued FAM 和 real-valued FAM。在 0 dB 时两者 time-domain RMSE 比较接近分别为 0.131 和 0.137但 frequency-domain RMSE 分别为 4.434 和 5.121到了 -12 dBcomplex FAM 的 time-domain RMSE0.208、frequency-domain RMSE6.051、frequency cosine similarity0.894而 real-valued FAM 分别为 0.224、7.411 和 0.851。说明在强噪声情况下同时建模 FFT 的 real 和 imaginary component 更有利于保存 amplitude-phase relationship而 real-valued attention 更容易损失这些信息。论文 Table 8Complex-valued FAM 和 Real-valued FAM 在不同 SNR 下的 time RMSE、frequency RMSE 和 frequency cosine similarity。作者还可视化了 -12 dB CWRU outer race fault 的 FAM attention weight。U-Net shallow layer 的 attention 分布相对较广说明浅层主要学习覆盖整个频带的噪声估计信息到了 bottleneck layerattention 更集中于高能量和 fault-related frequency band说明在网络最压缩的表示阶段模型会更加突出真正与信号恢复有关的频率区域。论文 Figure 18-12 dB CWRU 外圈故障下 Complex-valued FAM 的 attention weight heatmap包括 shallow layer 和 bottleneck layer。七、复杂噪声、弱故障与计算开销7.1 非 Gaussian 噪声下是否仍然有效前面的主实验主要使用 Gaussian noise但真实工业现场通常包含更加复杂的干扰。因此作者进一步构造两种 composite noiseImpulseGaussian 和 HarmonicGaussian。Impulse noise 用于模拟 cable contact failure、mechanical impact 和 transient spark 等稀疏高幅值干扰Harmonic noise 则使用 60 Hz、120 Hz 和 180 Hz sinusoidal component 模拟 inverter motor 和 power transmission device 产生的 EMI。随着目标 SNR 从 0 dB 降到 -12 dBImpulse amplitude factor 从 2.0 增加到 3.5Impulse sparsity 从 0.010 增加到 0.025Harmonic power ratio 从 0.10 增加到 0.25再额外加入 Gaussian noise 使总 SNR 达到目标值。论文 Table 9Impulse noise 与 Harmonic noise 在 0、-4、-8、-12 dB 下的参数设置。在 ImpulseGaussian 的 -12 dB 条件下ARDiff 的 time-domain RMSE0.175、frequency-domain RMSE5.317、SNR improvement15.803 dB。相比之下UCDIR 的 time RMSE0.406、frequency RMSE13.922AEDM 为 0.387 和 12.798DConformer 的 SNR improvement12.772 dB。说明面对稀疏高幅值冲击与 Gaussian noise 混合时ARDiff 依然能够较好地区分异常噪声和真正故障冲击。论文 Table 10CWRU 上 ImpulseGaussian composite noise 的去噪结果。HarmonicGaussian 更接近 EMI 场景。在 -12 dB 时ARDiff 的 time-domain RMSE0.183、frequency-domain RMSE5.703、SNR improvement15.463 dBDConformer 为 0.204、7.308 和 13.551 dB而 DRCAE 的 frequency-domain RMSE 恶化到 35.143说明部分模型在强周期干扰下出现明显性能崩溃。ARDiff 的 FAM 能够显式处理不同频段因此对 structured harmonic noise 的抑制更加稳定。论文 Table 11CWRU 上 HarmonicGaussian composite noise 的去噪结果。7.2 能不能保留本来就很弱的故障特征对于去噪模型来说另一个风险是只保留高能量结构而把本来就很弱的故障特征当成噪声删除。因此作者选择 CWRU ball fault signal 做 weak fault pattern preservation experiment。该样本即使在 clean signal 中Ball Spin FrequencyBSF本身也比 rotational frequency (f_R) 更弱属于比较难恢复的细粒度故障特征。实验结果显示从 0 到 -12 dBARDiff 恢复后的 frequency spectrum 基本能够跟随 clean signal高能量 spectral component 得到恢复在 envelope spectrum 中(f_R) 和 BSF 在四种噪声条件下都能够重新辨认出来。说明模型不仅能够恢复强谱峰也能够保留原始信号中幅值较弱的 fault-related component。论文 Figure 19CWRU ball fault 在 0、-4、-8、-12 dB 下的 weak fault feature restoration展示 spectrum、envelope spectrum 和 time-domain signal。7.3 ARDiff 的计算代价和实际部署问题ARDiff 的参数量为 5.26 M与其他对比模型基本处于相近规模因此模型本身并不算特别大。但是 diffusion model 的主要问题不是 parameter size而是 iterative reverse process 带来的 inference latency。ARDiff 在 0 dB 条件下 inference time12,803 ms在 -12 dB 条件下因为预测的 reverse timestep 更大需要执行更多恢复步骤因此 inference time 增加到 22,908 ms。UCDIR 为 18,641 msAEDM 为 24,590 ms而非 diffusion 模型快得多例如 DConformer10.5 ms、DRCAE5.4 ms、NL-FCNN3.9 ms。因此 ARDiff 当前并不能简单理解成“适合实时在线部署”的模型。它的主要优势是 extreme noise 下仍然能够稳定恢复故障相关的时频特征但这一性能是以较长 iterative inference time 为代价的。论文也明确把 inference acceleration 作为未来方向计划考虑 latent-space diffusion 和 model compression使扩散过程在低维 latent representation 中进行从而降低每个 step 的计算量。论文 Table 12ARDiff 与 UCDIR、AEDM、DConformer、DRCAE、NL-FCNN 的 inference time 和 parameter number 对比。八、总结这篇论文主要针对强噪声工业环境中的振动信号去噪问题作者认为现有方法的不足并不只是“噪声去得不够干净”而是缺乏对 fault-related spectral feature、input noise intensity 和 diffusion state scale mismatch 的统一处理。传统 signal processing 方法依赖人工参数Autoencoder 可能在压缩过程中损失细粒度频谱LSTM 和 Transformer 仍然倾向于一次性重构已有 conditional diffusion 则容易受到 heavily degraded condition 的误导而且大多侧重时域建模。ARDiff 因此提出三个互补组件。FAM 通过 Frequency Attention Module 和 Linear Complex Self-Attention 显式处理 FFT 后的 real/imaginary component并分别建模 low、mid、high frequency band使模型能够兼顾 amplitude、phase 和 fault-related spectral informationNSPM 根据 raw vibration signal 自适应预测 reverse diffusion starting timestep使不同噪声强度的输入不再使用相同去噪轨迹VSM 根据 predicted timestep 和 signal variance 对真实工业信号进行 scale alignment使输入更加符合 diffusion model 在对应 timestep 下的统计分布。三个数据集上的结果表明ARDiff 的优势随着噪声增强而更加明显。CWRU 在 -12 dB 下达到 time-domain RMSE0.208、frequency-domain RMSE6.051、SNR improvement14.210 dBHAI-PUMP 为 0.215、7.293 和 14.198 dBSNU Planetary Gearbox 为 0.199、6.335 和 14.880 dB。虽然在部分轻噪声条件下AEDM 的 frequency-domain RMSE 可能优于 ARDiff但进入 -8 dB、-12 dB 强噪声后ARDiff 的性能下降明显更慢这才是论文真正想证明的核心优势。消融实验进一步说明FAM、NSPM 和 VSM 分别负责 spectral fidelity、adaptive reverse timestep 和 variance scaling缺少任意一部分都会造成明显性能下降Complex-valued FAM 在 -12 dB 下将 frequency RMSE 从 real-valued FAM 的 7.411 降低到 6.051同时把 frequency cosine similarity 从 0.851 提高到 0.894。非 Gaussian noise 实验中ARDiff 在 ImpulseGaussian 和 HarmonicGaussian 的 -12 dB 条件下仍然取得 15.803 dB 和 15.463 dB 的 SNR improvement并能够在 weak CWRU ball fault 中恢复较弱的 BSF 特征。因此这篇论文真正有价值的地方可以概括为它不是单纯给 DDPM 加一个频域模块而是从“频谱信息如何保留、噪声程度如何判断、真实输入如何匹配 diffusion state”三个方面重新设计了工业振动信号的反向扩散过程。其主要不足则是 diffusion iterative inference 仍然非常耗时在 -12 dB 下单次推理达到 22,908 ms因此未来是否能够在保持强噪声恢复能力的同时进一步降低 reverse diffusion cost是 ARDiff 真正走向实时工业监测的关键。
返回列表