P3C-MADDPG算法的多无人机协同追捕对抗策略研究

高甲博; 肖玮<sup>*</sup>; 何智杰

摘要

针对策略未知逃逸无人机环境中多无人机协同追捕对抗任务，提出P3C-MADDPG算法的多无人机协同追捕对抗策略。首先，为解决多智能体深度确定性策略梯度(Multi-Agent Deep Deterministic Policy Gradient, MADDPG)算法训练速度慢和Q值高估问题，在MADDPG算法中分别采用基于树形结构储存的优先经验回放机制(Prioritized Experience Replay, PER)和设计的3线程并行Critic网络模型，提出P3C-MADDPG算法。然后基于构建的无人机运动学模型，设计追逃无人机的状态空间、稀疏奖励与引导式奖励相结合的奖励函数、加速度不同的追逃动作空间等训练要素。最后基于上述训练要素，通过P3C-MADDPG算法生成策略未知逃逸无人机环境中多无人机协同追捕对抗策略。仿真实验表明，P3C-MADDPG算法在训练速度上平均提升了11.7%,Q值平均降低6.06%,生成的多无人机协同追捕对抗策略能有效避开障碍物，能实现对策略未知逃逸无人机的智能追捕。

单位
中国人民解放军陆军勤务学院

收藏分享被引浏览

更新时间：2024-03-15 17:18

P3C-MADDPG算法的多无人机协同追捕对抗策略研究

摘要

产品服务

站内浏览

服务支持

联系方式

科研之友