CODS:面向可复用离线强化学习的迭代贝尔曼残差数据选择
离线强化学习(Offline RL)通常依赖一个固定的转移池来反复训练策略,这导致冗余数据在不同随机种子和超参数下产生高昂的计算成本。然而,简单的随机子采样可能会移除那些对长时程信用分配至关重要的稀有转移样本。针对这一矛盾,一项新研究提出了 CODS(Critic-guided Online Data Selection),一种由 critic 引导的迭代数据选择方法,旨在高效地筛选出可复用的高质量数据子集。
核心机制:迭代与匹配
CODS 的核心在于其交替迭代的过程:首先拟合一个与目标算法匹配的 critic,然后基于该 critic 的贝尔曼残差(Bellman residual)来获取高残差转移样本,最后冻结这些样本形成可复用的子集。与优先经验回放(Prioritized Replay)不同,CODS 生成的是静态数据产物,而非动态采样策略;与一次性残差选择相比,CODS 会随着 critic 的更新不断刷新残差分数,从而更精准地捕捉数据价值。
实验表现:显著优于基线
在 D4RL 基准的 20 个任务-算法组合上,CODS 在仅使用 10% 数据预算的情况下,保留了完整数据池性能的 96.6%。具体来看,CODS 在 19/20 个组合上超越了 ReDOR 和 OPER,并在所有 20 个组合上胜过其他所有子集选择基线。即使采用预先声明的分层推断并进行 Holm 校正,这六项优势依然显著。
效率与可扩展性
研究还发现,在保持总选择器更新次数固定的前提下,五轮获取比单轮获取在四个代表性任务上平均提升 11.23 个点,之后趋于饱和。通过等次数和等时间评估,研究者确认计算优势来源于数据复用,而非单次运行的加速。此外,机制分析和干扰实验揭示了 CODS 既能有效富集稀疏奖励,又对异常值敏感。
跨域泛化与结论
将 CODS 扩展到完整轨迹层面,在 ALFWorld 和 GSM8K 数据集上分别保留了 95.4% 和 96.5% 的池化成功率/精确匹配率,展示了其跨任务域的泛化能力。研究者强调,CODS 是一种可复用的选择流程,而非形式化的核心集保证。这一工作为离线强化学习中的数据处理提供了新思路,尤其适用于多任务、多超参数调优的场景,有望显著降低重复训练的计算开销。