针对传统的建模研究方法在应用于无人水面艇集群时会遇到复杂的动态海洋环境问题,提出了一种新的多智能体马尔可夫决策过程控制框架,将一致性控制和势博弈理论结合起来.在强化学习过程中,通过映射每个智能体的动作-价值函数值(Q值)表到全局最大势函数表,从而得到最优联合决策矩阵用于协同控制.进行了仿真试验,根据平均回报值给出了分析结果,验证了控制器决策矩阵的自优化性,以及对于较大环境扰动的自适应性.