摘要

针对多无人机任务规划问题,在多种约束与机动动作下,进行目标分配和突防决策统一建模与优化求解方法研究。首先,基于无人机自身优势、目标威胁以及突防概率分别建立目标分配优化函数和突防决策优化函数;然后,利用线性加权法将两者融合,形成多无人机协同任务规划统一目标函数;其次,在强化学习框架下,分阶段构建协同任务规划的状态空间和动作空间,并根据统一目标函数设计奖励函数;提出一种改进的蒙特卡洛树搜索强化学习算法,在统一目标函数最大收益下实现对无人机目标分配和突防决策问题的求解;最后,通过对比仿真实验验证所提出的方法的时效性和最优性。研究结果表明:相较于传统方法,所提出的方法在提升收敛程度的同时,将训练时间减少了15%。