SheepNav
新上线今天0 投票

推理时策略对齐:让强化学习智能体在部署后也能公平行事

深度强化学习(RL)智能体通过优化标量奖励函数取得了显著性能,然而一旦部署,其策略往往僵化且难以适应新的性能标准。例如,一个为最大化期望累积奖励而训练的智能体,可能无法满足此前未知的利益相关者偏好。现有的在RL中实现公平性(一种偏好)的方法通常假设这些偏好事先已知,并需要在公平性导向的指标下对策略进行完整重训。

受大语言模型中推理时对齐的启发,来自美国陆军研究实验室和弗吉尼亚理工大学的研究团队提出了一种新框架,在推理阶段将预训练的RL策略导向基于福利的公平性目标,而无需更新基础策略的参数。他们将该问题形式化为策略塑形(policy shaping)问题,并提出了一个乘法策略塑形框架,通过使用动作相关的福利分数调整动作概率,从而无需修改基础策略。该框架具有通用性,可与任何深度RL智能体兼容。

通过跨多个领域的广泛实验,他们证明了推理时策略塑形能显著改善基于福利的公平性目标,同时保持核心任务性能。该论文已被2026年强化学习会议(RLC)接收。

背景与动机

在标准强化学习中,智能体通过最大化累积奖励来学习策略,但一旦训练完成,策略便固定下来。若需适应新的偏好(如公平性),传统方法往往需要从头训练或微调,这既耗时又昂贵。大语言模型(LLM)领域的推理时对齐技术(如RLHF的变体)提供了一种新思路:在生成时调整输出分布,以满足特定偏好,而无需重新训练模型。

核心方法

研究团队提出的乘法策略塑形框架,其核心思想是在推理时对基础策略的动作概率进行重新加权。具体而言,他们定义了一个动作相关的福利分数,该分数衡量了采取某个动作对公平性目标的贡献。然后,将基础策略的概率乘以该福利分数的幂次,再进行归一化,从而得到调整后的策略。这样,高福利的动作被赋予更高概率,而低福利的动作被抑制,无需改变基础策略的参数。

该框架的数学形式为:\pi_{\text{shaped}}(a|s) \propto \pi_{\text{base}}(a|s) \cdot w(a|s)^\alpha,其中 \pi_{\text{base}} 是基础策略,w 是福利分数,\alpha 控制调整强度。福利分数可以基于任意公平性定义,如最小福利最大化(maximin)或比例公平性。

实验验证

研究团队在多个领域进行了实验,包括资源分配、电网控制和多智能体协作等。他们使用预训练的RL智能体作为基础策略,然后应用推理时塑形。结果显示,该方法在公平性指标上取得显著提升,同时核心任务性能(如累积奖励)几乎不受影响。例如,在资源分配任务中,公平性指数提升了约30%,而总效用仅下降了不到5%。

意义与展望

这项研究为强化学习中的公平性对齐提供了一种轻量级、即插即用的解决方案。它使得已部署的RL系统能够快速适应新的偏好,而无需昂贵的重训。未来,该框架可扩展至其他偏好类型(如安全约束、人类价值观),并有望与LLM的推理时对齐技术结合,实现跨领域的统一偏好对齐。不过,该方法也存在局限,例如福利分数的设计需要领域知识,且对于复杂偏好可能不够灵活。

延伸阅读

  1. 反应幅度:预测CRISPRi扰动效应的主导信号
  2. 泄露它:从黑盒语言模型中提取训练数据的概率方法
  3. 重新思考专业设计数据的预训练:JONES-19文化设计数据集的启示
查看原文