论文速递 | 高端装备故障诊断智能体:面向不平衡场景的持续对比强化学习
航空发动机等高端装备在实际运行中具有极高的可靠性要求,但其故障样本稀缺、故障模式复杂多样,且日常航班持续产生海量运行数据。传统的静态数据驱动诊断模型难以适应数据持续增长与工况环境变化,且直接对时序数据进行生成扩增存在先验失真的风险。针对这一工程实际难题,发表于期刊《Advanced Engineering Informatics》的研究论文《Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios》提出了一种融合环境交互感知与持续动态演进的智能体诊断框架,通过结合自编码对比表征学习与双网络深度强化学习机制,实现了高不平衡与数据流场景下的长效优化诊断。

该智能体系统的运行逻辑建立在航司实际业务流程的基础之上,将飞机航行与维护流程抽象为智能体所处的交互环境。在实际业务中,机载传感器采集到的运行参数通过空地通信系统传输至地面数据库,智能体根据近期飞行阶段的关键状态矩阵进行故障模式判别并输出维护建议。地面运维人员与工程专家结合客户通知报告核验实际状态,并将反馈信息与诊断记录存入经验回放池中。随着新航班数据的不断累积,智能体从经验库中持续提取历史状态进行参数迭代更新,使得诊断能力伴随业务数据增长而同步演进。

为了在极度匮乏的故障样本下提取更具区分度的特征,系统设计了面向不平衡时序数据的特征区分模块。该模块首先利用大量正常飞行样本对长短期记忆网络构建的自编码器进行预训练,使编码器充分掌握机载参数的基础时序压缩表达。然后,模型直接利用已有样本中相同故障类别构建正样本对,不同类别构建负样本对,并在对比学习损失函数中为正负样本分别引入调节权重以平衡类别比例。编码器在此阶段以微调方式更新,在保留参数总体运行规律的同时,最大化同类故障的投影聚合度并拉大不同故障类别的空间间距。

在决策与类别识别阶段,系统采用了对决双重深度Q网络作为智能体的核心架构。该模块将预训练好的对比学习编码器特征冻结并输入至主干网络,通过分解为状态价值流与动作优势流两组线性层,分别评估当前装备状态的基础价值以及选取特定诊断动作的相对优劣,从而避免单一故障倾向对整体状态价值评估的干扰。同时,网络结构配置了实时更新的策略网络与周期性同步的目标网络,通过解耦动作选择与目标值计算过程,有效抑制强化学习中常见的Q值高估现象,使智能体输出更加平稳。

针对故障样本类别极度不平衡的问题,智能体环境构建了基于样本出现频次反比的归一化动态奖励规则。当智能体对出现频次极低的稀有故障类型做出正确或错误判断时,环境会施加绝对值更大的奖惩反馈,促使智能体主动关注少数类样本特征。训练过程中,智能体遵循逐渐衰减的随机探索策略,在初始阶段鼓励对各类诊断动作进行广泛探索,随着经验积累逐步收敛至高置信度的决策输出,保证在不同故障样本规模下都能保持稳定的学习收敛过程。

该技术框架围绕发动机气路系统的排气温度偏差、转速偏差、燃油流量偏差等核心参数构建完整输入序列,将数据预处理、特征自监督对比编码与强化学习决策闭环整合。从数据流接入、表征提取到自适应奖励决策的整体流程具备良好的模块独立性,不仅为动态环境下的航空发动机多类气路故障诊断提供了持续学习的智能体实现方案,也为其他复杂工业装备在高不平衡场景下的状态监测与智能维护提供了工程参考。
参考文献:
Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios[J]. Advanced Engineering Informatics, 2025, 65(C): 103297.
https://www.sciencedirect.com/science/article/abs/pii/S1474034625001909

浙公网安备 33010602011771号