SheepNav
新上线今天0 投票

多AUV自组网目标跟踪新突破:基于值梯度引导的多智能体扩散强化学习方法

多自主水下机器人(AUV)自组网协同目标跟踪,是海洋探测与防御领域的关键技术。然而,在水下声学通信受限、网络拓扑动态变化以及海洋扰动不确定的环境下,实现高效协同面临巨大挑战。尽管多智能体强化学习(MARL)通过集中训练与分散执行展现潜力,但现有方法在高维联合状态-动作建模和策略生成方面存在噪声敏感、训练不稳定等问题。为此,研究者提出了一种名为VGG-MADiffRL的值梯度引导多智能体扩散强化学习算法,并配套设计了MDCA扩散分层控制架构,为动态水下环境中的协同跟踪提供了新思路。相关论文已提交至arXiv(编号2608.12436)。

方法核心:扩散模型与值梯度结合

VGG-MADiffRL将扩散模型引入多智能体策略学习。扩散模型通过逐步去噪生成动作,天然具备处理高维连续动作空间的能力。但标准扩散策略可能生成低回报动作,为此,算法在逆向去噪过程中引入值梯度,引导动作生成朝向更高期望回报的方向。同时,采用孪生价值网络与软目标更新,抑制过估计与训练振荡,提升收敛稳定性。

架构设计:三层闭环控制

MDCA架构分为全局智能控制层本地在线训练层物理动作执行层,形成三层闭环。全局层负责任务分配与全局优化,本地层基于VGG-MADiffRL进行策略学习,执行层将决策转化为物理动作。这种分层设计实现了任务、决策与执行的协同优化,尤其适应水下通信延迟与拓扑变化。

实验验证与工程价值

实验表明,VGG-MADiffRL在协同跟踪场景中收敛更快、跟踪精度更高、训练过程更平滑。研究者还建模了声呐探测机制与海流扰动,使仿真更贴近实际。该方法不仅提升了算法性能,也为多AUV系统在动态水下环境中的实际部署提供了工程参考。

局限与展望

尽管成果显著,但研究仍处于仿真阶段,真实海试尚待开展。未来,如何将算法迁移至真实AUV平台,并应对更复杂的水声信道与能耗约束,是后续研究的重要方向。

延伸阅读

  1. Transformer残差流中的几何与行为分层:预测方向作为特权锚点
  2. 个性化评分建模:一种基于学习的多专家睡眠阶段标签生成框架
  3. 双时空归因:为循环图异常检测打造架构对齐的可解释性框架
查看原文