多机空战决策的角色解耦与关系建模进展

本期新增的 13 篇文献里,多智能体强化学习仍然是最密集的技术路线,但关注点已经从「能不能打赢」转向「怎么把战场结构写进网络里」:角色、关系图、注意力、位置编码这些结构性先验被反复用来对抗共享编码器带来的表征纠缠。与此并行的是两类工作,一类在补基础设施的短板——开源环境、吞吐、跨机型迁移,另一类把大语言模型、知识图谱和软件智能体引入态势感知与目标价值评估这类偏认知的环节。装备与综述层面,本期收录了两则协同作战飞机的动态和两篇综述,分别覆盖认知电子战与国防安全决策支持。

角色解耦:从共享编码器到专属专家

多无人机空战的一个共性痛点是,共享编码器会把合作与对抗两类表征混在一起,梯度互相干扰。REMP(链接)针对这一点做了比较彻底的拆分:为自身智能体、友方和敌方分别配置独立的角色专属专家编码器,把潜在表征解耦开。第二个设计是多尺度位置编码,用傅里叶特征映射缓解 Transformer 的频谱偏差,目的是让网络能抓到对精确机动关键的细粒度三维空间特征。整个结构嵌在置换等变的 Transformer 骨干上,以支持智能体数量可变时的关系推理。在 5-vs-5 对抗基于规则的专家设定下,报告胜率 90.7%、全歼率 62.3%、交换比 0.21。

DRG-MAPPO(链接)走的是另一条解耦路径——不拆编码器,而是把角色显式建模进分层策略。框架先构建战场交互的图表示,用图注意力提取友军、敌军与威胁之间的关系特征;高层策略据此动态分配战术职责,例如 leader 与 supporter;低层策略以角色和编码后的图关系特征为条件输出离散机动动作。这样战术策略与协同执行是联合优化的,另外还设计了一个目标优先级辅助任务,用来促进集火行为的涌现。报告胜率 87%,作者称达到 state-of-the-art。两篇工作放在一起看,REMP 解耦的是「谁」的表征,DRG-MAPPO 解耦的是「干什么」的职责,前者靠架构,后者靠分层加图结构。

关系建模与去中心化分配

把关系结构显式写进策略的不止 DRG-MAPPO。空天防御场景下的去中心化武器-目标分配工作(链接)同样采用注意力增强的多智能体强化学习,处理的是防御系统中武器与目标之间的分配问题,强调去中心化执行。这一支的共同假设是:战场实体间的交互是时变且稀疏的,用注意力或图结构去筛选关键关系,比让全连接网络自己学更省样本。

分布式模型扩散(链接)则从控制侧处理多智能体联合轨迹优化。它把基于采样的模型预测控制推广到分布式设定,面向高度非线性、非凸、非光滑的多智能体系统,理论上证明了多智能体非凸问题下的收缩性以及对通信延迟的鲁棒性。实验里,在加入延迟的条件下,circleswap 的 makespan 相比集中式 Model-Based Diffusion 改善 31%,空战胜率提升 25%。这篇的价值在于给了延迟下分布式 MPC 一个可证的界,而不是纯经验性的调参。

有人-无人协同的系统级建模

有人-无人协同这一块,本期有一篇偏系统工程而非学习的方法。面向冲突的有人-无人协同空战建模(链接)提出基于冲突导向分析的系统级建模方法,形式化描述侦察、打击、压制敌方防空(SEAD)任务以及空空交战,刻画各机载系统的功能角色及其对任务结果的相互影响,用于比较不同交互模式并识别对协同性能影响显著的关键系统组件。这类工作不产出策略,产出的是评估框架,和上面几篇 MARL 工作恰好互补。

装备动态方面,通用原子 FQ-42A 协同作战飞机已与美空军有人战机共同飞行(链接),更真实的协同演示在推进;Anduril 则向波兰推介两款无人机,用于配合波兰计划中的 F-35 与阿帕奇机队(链接)。另外还有一篇概念性框架,提出以母型无人自主作战飞行器(MUACV)指挥多架无人作战与侦察机的协同中队构想,综合深度学习、深度强化学习、传感器融合、优化、Transformer 推理与自适应电磁隐身管理,并保留人类监督(链接)。该文摘要未给出定量结果。

环境、评测与跨机型迁移

BVR Sim(链接)是本期基础设施层面最值得关注的一篇。它是一个开源、Gymnasium 风格的异构超视距空战强化学习环境,支持 F-15、F-16、F/A-18、F-22 等多种 JSBSim 机型,武器、传感器、控制器与对手均可配置。核心设计是统一的战术动作接口:在机型专属内环控制器之上指定期望航向、高度、速度与武器发射,使同一策略可以跨异构平台运行。环境提供可互换的 Python 与加速 C++ 后端、实体导向观测、组合式奖励、脚本对手、回放与可视化,以及多智能体学习框架适配器。性能上,C++ 后端在 1-vs-1、0.4 秒决策间隔下达到每墙钟秒 104 仿真秒的吞吐,场景规模可扩展到 10-vs-10 仍保持实用,并验证了策略的跨机型迁移。对于做异构编队的研究者,统一动作接口这一层抽象比吞吐数字更关键。

大模型与知识结构进入决策链路

DECIS(链接)处理的是目标价值评估。它指出静态模型难以适应动态战场、专业领域数据稀缺这两个问题,给出的方案是基于检索增强生成(RAG)的三阶段架构:用 RAG 把最优评估策略匹配到当前情境,再由大语言模型组件自主生成并优化目标列表。报告的最大连通分量指标为 0.6,对比 PageRank 的 0.75 与 Betweenness Centrality 的 0.8。

另一篇面向开放式态势感知与想定仿真的工作(链接)把 LLM、知识图谱与软件智能体串成一条数据处理流水线,用于军事智能中的合成观测生成与处理。作者给出三项贡献:面向 LLM 的知识表示综述与八阶段指导、AI 应用采纳中的信任问题综述与指南、以及智能体式数据处理流水线的实现。关键结论是通过结构化领域知识支持,基础模型能生成可供领域专家评估的输出,软件智能体使得基于当前态势对潜在行动方案(CoA)想定进行实验成为可能。摘要未给出定量指标。

两篇综述

认知电子战综述(链接)从 AI 视角考察无人机在非对称电子战威胁下执行连续控制任务的认知架构。它的出发点是传统规则算法难以应对动态干扰与欺骗,无人机需要在不可预测环境中维持目标搜索、探测、捕获与跟踪等任务的连续性。文章讨论了无人机连续控制任务与认知电子战的关系,对每类任务给出文献中常用的模型示例,并分析了自适应控制机制在抵御网络物理操纵、保持飞行稳定性方面的作用。

需要说明的是,本期素材中另有一篇国防安全决策支持综述被列入概览,但未提供单独的标题、链接与摘要信息,此处不作展开。

本期文献列表

  1. REMP: A transformer with role-specific experts and multi-scale positional encoding for autonomous multi-UAV air combat — https://doi.org/10.1007/s44443-026-01157-9
  2. AI Integration in Autonomous Collaborative Combat Unmanned Aircraft Squadron — https://doi.org/10.61359/11.2106-2630
  3. Decentralized Weapon-Target Assignment in Aerospace Defense Systems: An Attention-Enhanced Multi-Agent Reinforcement Learning Approach — https://doi.org/10.21203/rs.3.rs-10847429/v1
  4. DRG-MAPPO: Hierarchical Dynamic Role-Graph Multi-Agent Reinforcement Learning for Cooperative Air Combat — https://arxiv.org/abs/2609.11155v1
  5. A conflict-oriented model for coordinated manned-unmanned aerial teaming in complex operational environment — https://doi.org/10.1088/1742-6596/3318/1/012011
  6. BVR Sim: An Open and High-Throughput Environment for Heterogeneous Air-Combat Reinforcement Learning — https://arxiv.org/abs/2608.25419v1
  7. Cognitive Electronic Warfare In The Continuous Control Missions Of Unmanned Aerial Vehicles: A Comprehensive Review From An Artificial Intelligence Perspective — https://doi.org/10.17134/khosbd.1909594
  8. DECIS: An LLM-Based Value Assessment Framework for Targets — https://doi.org/10.62762/tis.2026.310611
  9. General Atomics FQ-42A Vengeance CCA Now Flying Together With USAF Fighters — https://www.twz.com/air/general-atomics-fq-42a-vengeance-cca-now-flying-together-with-usaf-fighters
  10. Anduril doubles down on Poland with autonomous aircraft pitch for F-35, Apache — https://www.defensenews.com/global/europe/2026/09/09/anduril-doubles-down-on-poland-with-autonomous-aircraft-pitch-for-f-35-apache/
  11. AI support for continuous open-ended situation awareness and scenario simulation: Design and early experiments in military intelligence — https://doi.org/10.1080/08839514.2026.2721301
  12. Distributed Model-Based Diffusion: Finite Horizon Contraction under Bounded Delay — https://arxiv.org/abs/2608.27685v1

AI 使用声明:本文由自动化程序采集公开文献,并使用大语言模型辅助
整理、归纳与撰写。所有内容均来自已公开发表的论文与新闻,
关键结论附有原文引用并已程序校验出处。内容可能存在疏漏或理解偏差,
请以原文为准;涉及军事应用的表述均限于公开学术讨论,不代表任何机构立场。

posted on 2026-10-02 02:01  小蚂蚁xmy  阅读(2)  评论(0)    收藏  举报