尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

机械故障诊断公开数据集盘点:轴承、齿轮箱与RUL资源全指南

机械故障诊断公开数据集盘点:轴承、齿轮箱与RUL资源全指南 简介在工业智能运维与故障预测研究中高质量数据是构建可靠模型的基础。然而机械故障诊断领域的公开数据分散于不同机构采样率、标注方式与工况设置差异巨大给算法验证与对比带来挑战。本文以振动信号分析为核心系统梳理了从经典轴承故障数据到齿轮箱复合故障、再到全寿命退化数据的代表性资源涵盖CWRU、Paderborn、IMS、XJTU-SY及C-MAPSS等常用集合。通过理解传感器布置、采样频率与故障注入方式研究者可以更合理地进行跨工况泛化、迁移学习与剩余寿命预测实验。文章同时总结了数据划分、重采样与引用规范等实操要点为故障诊断与预测性维护方向的工程实践和学术研究提供可落地的数据选型参考。 机械故障诊断圈子里有个不成文的共识比模型更难搞的是数据。我见过不少刚入门的朋友兴冲冲地准备训练一个故障诊断网络结果卡在“没数据可用”上。倒不是网上完全找不到资源而是机械故障诊断领域的公开数据集实在太分散——散落在各个大学实验室、各种学术会议的比赛页面、各种需要填表申请的机构网站上格式和标注方式也千奇百怪。这篇就把我这些年用过的、圈子里公认靠谱的机械故障诊断公开数据集集中整理一遍说清楚每个数据集能干什么、不能干什么、下载时要注意什么给刚入坑的同行们一张能直接照着走的资源地图。1. 先聊两句为什么机械故障诊断领域最缺的其实是数据1.1 工业故障数据的“稀缺悖论”做故障诊断算法研究的人最常面对的就是数据问题。工业场景里故障本来就是小概率事件设备正常跑着跑着突然坏了你还要恰好装了传感器、恰好采到了完整信号、恰好把故障样本留下来了——这概率低得可怜。再加上很多工厂对数据敏感设备参数、工艺流程、运维记录都属于商业机密不可能随随便便发布出来。所以你能找到的公开数据集几乎全部来自高校实验室和科研机构的实验台而不是真实工厂流水线。这不是坏事只是你得心里有数用实验台数据训练出来的模型到了工业现场大概率会“水土不服”。所以我一直强调公开数据集的价值在于“算法验证”和“方法论对比”而不是直接把模型搬到现场就能用。1.2 公开数据集本身的“代差”问题另一个容易被忽略的问题是机械故障诊断数据集不是统一标准化的工业产品。同样是轴承数据凯斯西储大学用12kHz采样帕德博恩大学用64kHz采样IMS用20kHz采样不同实验台的传感器安装位置、轴承型号、故障注入方式都不一样。这导致两个后果一是你在不同数据集上复现同一个算法效果可能差得离谱二是跨数据集做迁移学习时分布差异特别大这反而成了很多研究者做域适应算法时的天然实验场。以我的经验拿到任何一个数据集先别急着跑模型先花半天把它的实验说明书读透搞清楚传感器装在哪、采样率多少、故障是怎么制造出来的。这一步省下来的时间比你后面瞎调参省多了。1.3 看一个数据集值不值得用先看这五个维度我每次评估一个公开数据集会下意识地过一遍这五个维度传感器类型和安装位置、采样频率、工况变化、故障类型覆盖、是否有全生命周期数据。传感器决定你看到的信号形态采样频率决定你能分析的频带范围工况变化决定模型能不能泛化故障类型覆盖决定你是在做二分类还是十分类是否有全生命周期数据则决定了你能不能做剩余寿命预测。后面介绍每个数据集的时候我都会按照这五个维度来拆解。2. 轴承故障诊断数据集入门必看的三张牌2.1 CWRU凯斯西储轴承数据集最经典的“Hello World”如果机械故障诊断领域也有“MNIST”那一定是凯斯西储大学Case Western Reserve University的轴承数据集。这是绝大多数研究者第一个接触的公开数据集引用量高到离谱。实验台结构很简单一个2马力电机驱动一根轴轴上安装测试轴承通过电火花加工在轴承上制造单点损伤然后用加速度传感器采集振动信号。数据集里的核心信息我给你捋一遍轴承型号是6205-2RS JEM SKF深沟球轴承故障位置分内圈、外圈、滚动体三处损伤直径有0.007英寸、0.014英寸、0.021英寸、0.028英寸四档负载从0到3马力分四档对应转速大约在1730到1797转/分之间。采样频率有两档12kHz和48kHz每个文件里同时包含驱动端加速度信号、风扇端加速度信号和基座加速度信号。下载地址是凯斯西储大学轴承数据中心的官网文件是mat格式用Python的scipy就能读。这个数据集最大的优点是结构清晰、标注完整、样本量大拿来验证基础算法非常合适。但它的缺点也明显数据太“干净”了——固定转速、固定负载、人为制造的单一损伤跟真实世界的复合故障和变工况场景相去甚远。如果你只在CWRU上做实验然后声称算法很好用审稿人大概率会问一句换到别的数据集上试试2.2 Paderborn轴承数据集人工损伤和真实损伤都有的进阶选择德国帕德博恩大学Paderborn University公开的轴承数据集是我个人比较喜欢的一个中阶选择。它的实验台用了6203深沟球轴承采样频率高达64kHz除了振动信号之外还同步记录了电机电流信号这一点对做多传感器融合的研究者很有吸引力。这个数据集最值得称道的地方是它把故障分成了三类健康状态、人工损伤和真实损伤。人工损伤又分电火花加工、钻孔、手动雕刻三种方式真实损伤则来自加速寿命试验是轴承在运行过程中自然磨损出来的。这一点非常关键因为人工损伤和真实损伤在信号形态上是有本质区别的——人工损伤的边缘规则、信号特征明显真实损伤往往伴随着更复杂的表面形貌变化。很多做迁移学习的研究者就是利用这两种损伤之间的分布差异来验证算法鲁棒性。工况方面Paderborn数据集提供了四种不同的转速、负载扭矩和径向力组合方便做跨工况泛化实验。获取方式稍微麻烦一点需要在KAt数据中心的官网上填写数据使用协议提交后等审核。这个流程我用过等一两天就下来了别嫌麻烦数据质量完全值得。2.3 MFPT轴承数据集轻量级备选方案MFPTMachinery Failure Prevention Technology数据集来自美国机械故障预防技术协会知名度不如CWRU但胜在轻量文件数量不多数据格式统一适合快速验证。它主要包括正常基线数据、外圈故障数据、内圈故障数据部分版本还包含滚动体故障和变速工况数据。采样率比较高振动信号清晰但在变工况覆盖和故障类型丰富度上不及前面两个数据集。这个数据集在官网可以申请下载现在已经有不少镜像我建议用它作为第二或第三个验证数据集用来证明你的算法不是只在CWRU上有效。如果连CWRU和MFPT上都能跑出稳定结果审稿人至少会认为你的方法有一定泛化能力。数据集部件采样率主要故障类型工况变化获取方式CWRU6205轴承12kHz/48kHz内圈、外圈、滚动体单点损伤4档负载官网免费下载Paderborn6203轴承64kHz人工损伤、真实损伤、健康4种工况组合官网申请审核MFPT轴承约97.656kHz内圈、外圈、滚动体故障有限官网申请或镜像3. 全寿命退化数据集做预测性维护绕不开的资源3.1 IMS轴承全寿命数据集自然退化的经典样本如果你做的是剩余寿命预测RUL而不是简单的故障分类那IMS数据集应该在你的列表里。这是美国辛辛那提大学智能维护系统中心IMS在NSF资助下做的滚动轴承全寿命试验数据托管在NASA的预测与健康管理数据仓库里。实验用的是Rexnord ZA-2155轴承同一根轴上装4个轴承持续运行直到轴承真正失效。采样率20kHz每10分钟记录一次每个文件包含20480个采样点。它一共公开了三组试验数据每组都完整记录了轴承从健康到失效的全过程。这个数据集的珍贵之处在于它是自然退化不是人工制造故障所以趋势特征更接近真实设备。使用IMS数据时要特别注意官方没有给你标注每个文件的“健康度分数”或“剩余寿命值”需要你自己定义退化起始点、自己构建RUL标签。业界常用的做法是取信号特征比如RMS、峭度的拐点作为退化开始时刻之前视为健康期之后按线性或非线性方式递减到0。3.2 XJTU-SY轴承退化数据集国内团队开源的诚意之作西安交通大学团队公开的XJTU-SY轴承数据集是近几年国内高校开源数据里质量比较高的一份。实验台采用LDK UER204滚动轴承三组不同工况每组包含5个轴承一共15个完整全寿命数据。采样频率25.6kHz每次记录1.28秒每分钟保存一个样本文件。这个数据集有一个很大的优点——故障类型不预设。也就是说轴承不是被人工加工出特定损伤而是跑着跑着自己坏的。最终标注的故障类型包含外圈磨损、内圈磨损、保持架断裂等多种情况非常接近真实世界的故障演化。我记得当时第一次跑这个数据时明显感觉到信号特征比CWRU“脏”多了但正是这种“脏”反而让模型更有说服力。获取方式官网填写申请表格或者在一些学术镜像仓库里能找到。我的建议是直接走官网申请确保数据完整、版本可靠。3.3 PHM 2012/FEMTO-ST竞赛级轴承加速退化基准IEEE PHM 2012数据挑战赛使用的轴承退化数据来自法国FEMTO-ST研究所的PRONOSTIA实验台。这个数据集由专门设计的加速寿命试验平台生成轴承在短时间内被加速到失效同时采集水平和垂直两个方向的振动信号采样率25.6kHz。整个数据集包含17个轴承样本其中训练集6个、测试集11个每种工况条件下都有从健康到失效的完整记录。测试集的RUL并不直接公开当年比赛就是让参赛者提交预测结果来评分。虽然现在很多论文已经把测试集的标签整理出来了但如果你是想严格评估自己的RUL算法建议还是只使用公开的训练集和测试集划分方式保持结果横向可比。这个数据集在业内被视为RUL预测的标准基准之一跟C-MAPSS后面会讲搭配使用一个做部件级轴承退化、一个做系统级发动机退化基本就能覆盖大部分RUL研究场景了。3.4 做退化研究时容易忽略的三个细节用全寿命数据集的时候我有三个血泪教训想说一下。第一一定要先画退化曲线再决定用什么特征很多论文上来就用RMS但某些故障模式在RMS上根本没有明显趋势要看峭度或频域能量。第二数据集里的文件是按时间顺序编号的但时间戳可能有异常做数据清洗时要检查文件之间的时间间隔是否一致。第三无论用什么方法构建RUL标签要在论文里写清楚“健康期定义”和“退化模型假设”否则结果完全不能复现。4. 齿轮箱和传动部件数据集复合故障才是真实主旋律4.1 SEU齿轮箱数据集齿轮和轴承一起看东南大学公开的SEU齿轮箱数据集是齿轮箱故障诊断里比较常用的一个。实验对象是二级齿轮箱包含齿轮故障齿根裂纹、缺齿和轴承故障滚动体故障、内圈故障、外圈故障另外还有健康状态样本。采样率5120Hz除了振动信号之外还记录了一些转速、扭矩信息可以用于分析工况变化的影响。这个数据集比较有意思的地方在于它是在同一个齿轮箱平台上采集的故障类型跨度涵盖了齿轮和轴承两类部件。这样你就可以研究“齿轮故障对轴承信号的影响”这类耦合问题或者做多部件复合故障诊断。数据提供方对文件命名做了分类规范用过的都知道它的目录结构比较清晰适合用来做跨工况的模型泛化实验。具体转速负载组合有两组可以在官方说明里查到。4.2 PHM 2009挑战赛工业齿轮箱的多通道选择PHM Society在2009年发布的齿轮箱故障诊断数据集是另一个值得关注的资源。数据来自工业齿轮箱试验台包含健康状态、缺齿、齿根裂纹、齿面磨损等典型故障实验时设置了不同转速和不同负载组合多个加速度传感器同时采集信号通道数比我之前提到的轴承数据集都要多。多通道信号带来的好处是可以做信号融合、通道选择这类研究坏处是数据维度暴涨计算量也跟着上去了。我见过不少研究生在这个数据集上反复折腾特征提取其实没必要——先做简单的频带筛选把和故障特征频率相关的频段锁定再上深度学习效果会好很多。4.3 复合故障不是“多个单故障的叠加”这里我想多说一句复合故障诊断的难度不在于“多分类”而在于不同故障之间的调制和耦合。齿轮磨损和轴承内圈损伤同时发生的时候振动信号会互相调制特征频率可能出现边频带混叠。这种问题用单一数据集做简单分类是学不到的SEU和PHM 2009这种多故障、多工况的齿轮箱数据集才是练习复合故障诊断的正确场地。5. 系统级与仿真数据从部件到整机健康管理5.1 C-MAPSS发动机退化仿真的标杆说完部件级数据集必须提一下NASA的C-MAPSS数据集。它的全称是Commercial Modular Aero-Propulsion System Simulation是一个用涡扇发动机仿真模型生成的多变量时间序列数据集。C-MAPSS包含四个子集FD001到FD004每个子集都由训练集和测试集组成传感器数量21个操作条件设置3个。FD001是单工况单故障模式FD002加入了6种工况切换FD003引入了不同退化模式FD004是工况和模式都最复杂的。这个数据集是系统级健康管理的标杆主要用于剩余寿命预测。每个训练样本是一段运行周期的传感器读数序列从发动机服役开始到某一时间点测试集要求你预测该发动机还能运行多少个周期。它的RUL标签是显式给出的在测试集对应的文件里所以可以直接用来训练回归模型。关于C-MAPSS我个人印象最深的是它看似是标准表格数据但如果你把传感器读数看成一维时序模型就能做得非常出色如果只做单时间点的特征统计性能天花板很低。也就是说这个数据集的天然结构就在推动大家使用时序建模思路。5.2 仿真数据的价值与局限经常有人问C-MAPSS是仿真生成的用它做研究有意义吗我的看法是仿真数据的优势在于“可控、可重复、有明确标签”这对算法开发阶段非常重要。你可以自由地注入故障、改变工况、控制噪声水平观察模型在不同条件下的表现。但仿真数据无法替代真实数据因为它的物理场简化了很多细节比如传感器噪声特性、环境干扰、部件间的非线性耦合。在实际项目里我会把C-MAPSS当作“算法预筛选”平台在仿真数据上快速淘汰掉一批不靠谱的方法再把幸存下来的候选算法放到真实数据集比如XJTU-SY或IMS上做进一步验证。这样既节省时间又能保证评估过程相对客观。6. 数据集选择策略先想清楚任务再选数据6.1 按任务类型选择数据集很多读者拿到这篇文章就直接去下载了但我建议你先想明白自己要做的到底是什么任务。不同任务对数据集的要求差异很大我用一个表格帮你理清楚任务类型推荐数据集选择理由故障分类有监督CWRU、SEU、PHM 2009标注完整、类别明确、样本充足跨工况泛化Paderborn、XJTU-SY有多工况设置分布偏移明显故障迁移/域适应CWRU和Paderborn搭配、SEU不同工况人工损伤与真实损伤的分布差异适合做域适应异常检测无监督IMS早期阶段、XJTU-SY健康段需要定义健康基线剩余寿命预测RULIMS、XJTU-SY、PHM 2012、C-MAPSS有全生命周期数据或标签多传感器融合Paderborn、PHM 2009同步多通道信号6.2 数据集的“可比性”比数据集本身更重要做研究写论文的时候我最关心的其实不是“哪个数据集最先进”而是“我的结果能不能跟别人的结果公平对比”。同一个数据集、同一个测试划分、同一个评估指标才谈得上方法优劣。所以我会强烈建议你在论文里明确写清楚你用的是哪个数据集的哪个工况、哪个故障类型、训练集测试集怎么划分的、用了多少样本。很多复现不了的文章问题就出在这——数据集版本不透明、数据划分随机。6.3 一个小习惯把“数据使用说明书”写进代码仓库我有段时间做项目经常来回切换数据集每次都要重新翻官方文档非常低效。后来养成了一个习惯每用一个数据集就在项目的README里建一节“数据集说明”把来源、版本、文件结构、采样率、通道含义、故障编号规则全记进去。这样做还有个额外好处——论文投稿时审稿人问数据细节我能直接对着文档回答不用临时翻官网。这个习惯也推荐给大家。7. 用公开数据集做研究这些坑我替你踩过了7.1 下载之前先读README听起来像废话但真的很多人不读。每个数据集都有自己特有的文件命名规则、故障编号方式和通道顺序不读README直接读数据最常见的后果是把通道A当成通道B把故障类型编号搞反然后模型训练出一个完全错误的映射关系。CWRU的文件命名里含有转速和损伤尺寸信息SEU的文件夹按工况分组这些细节都在官方文档里写得清清楚楚。7.2 采样率不一致是隐藏地雷如果你同时用多个数据集训练一个模型一定要检查采样率是否一致。CWRU有12kHz和48kHz两种文件Paderborn是64kHzSEU是5120Hz如果直接把它们读进来混在一起模型学的根本就不是故障特征而是采样率差异。处理办法很简单统一重采样到较低的频率或者把频带限制在多个数据集都能覆盖的范围内。这个坑特别隐蔽我见过不止一个团队在这种地方浪费了一周时间。7.3 数据划分不当指标虚高做故障诊断特别容易犯“数据泄漏”的错误。比如把同一段连续信号的一部分放进训练集、一部分放进测试集模型记住的是信号的连续性而不是故障特征测试准确率虚高得吓人。正确做法是按实验批次或时间窗口划分训练集和测试集来自不同的实验记录或不同的运行周期。全寿命数据集更是如此不要随便把一个轴承的前半段和后半段分别塞进训练集和测试集那样等于把“答案”提前给了模型。7.4 用公开数据集发论文记得规范引用最后提一句学术规范。很多公开数据集都有明确的使用协议和引用要求比如Paderborn需要引用他们指定的论文XJTU-SY也有对应的引用格式。用别人的数据做研究发文时规范引用是基本的行业尊重也能帮助围观者找到数据源头别嫌麻烦。我在实际项目里最常用的一套组合是CWRU做快速验证Paderborn做跨工况泛化XJTU-SY或IMS做退化趋势分析C-MAPSS做整机RUL验证。这套组合覆盖了从入门到进阶的几乎所有需求。你第一次使用某个数据集时请一定先下载最小的样本文件跑通全流程再上全量数据——因为每个数据集的处理细节都有差异先用小文件排除代码层面的坑再大面积铺开会顺很多。本文还有配套的精品资源点击获取
返回列表