SheepNav
新上线今天0 投票

边际覆盖信用降低并行状态熵优化中的冗余探索

强化学习中的探索与利用平衡一直是智能体高效学习的关键。最新研究提出了一种名为 MCC-PGPSE 的新方法,旨在解决并行策略探索中的冗余问题。该方法通过为每个策略分配边际覆盖信用,鼓励互补探索,从而提升整体状态空间的覆盖效率。实验表明,该方法在多个基准测试中均取得了积极效果,为多智能体强化学习提供了新的思路。

研究背景

在强化学习中,智能体需要通过探索环境来收集足够的状态信息。并行状态熵最大化(PGPSE)是一种通过训练多个独立策略来扩展状态空间覆盖的方法。然而,PGPSE 的团队熵指标只衡量集体探索效果,无法识别哪些策略贡献了非冗余的覆盖。这可能导致多个策略重复访问相似状态,浪费计算资源。

方法创新

MCC-PGPSE 结合了留一策略覆盖和状态所有者专业化两种机制,为每个策略估计边际贡献。该方法保留了 PGPSE 的集体目标,同时根据这些信用分配非负的辅助内在奖励,且不改变奖励总量。这种重新分配旨在抑制冗余访问,促进互补覆盖。

实验验证

研究者在控制环境、七个公开离散状态基准以及原始 PGPSE 协议中的 Room 和 Maze 设置中进行了评估。结果显示,MCC-PGPSE 在所有测试设置中,相对于熵基线,在归一化团队状态熵和状态支持方面均获得了积极的正向最终窗口增益。控制任务比较和固定套件的公开汇总结果显著,而五种子原始协议比较方向一致。

消融研究

消融实验和信用对齐控制表明,大部分增益来自留一策略覆盖,而非非均匀加权、不匹配的信用或神经新颖性。这支持了基于贡献的条件辅助奖励分配作为提高并行策略互补覆盖的可解释方法的有效性。

未来展望

这项研究为多智能体强化学习中的探索策略提供了新的视角,未来可进一步探索在连续状态空间中的应用,以及与其他探索机制的融合。

延伸阅读

  1. 曲率感知的自适应最近邻分类:CARSANN 框架
  2. 自解释多标签图神经网络:为关联证据归因而生
  3. Dandelion:球面神经模拟行星动力学的新方法
查看原文