SheepNav
精选今天0 投票

对抗式闭环课程:让角色扮演智能体在自我博弈中持续进化

当训练场景不再"够用"

基于大语言模型(LLM)的角色扮演智能体,已被广泛用于个性化助手、社交模拟等场景。但当前主流的强化学习(RL)方法有一个共同的假设:训练场景池在训练开始前就固定下来了。

问题随之而来。随着智能体能力提升,它表现不佳的场景也在不断变化——昨天还难倒它的对话,今天可能已经轻松应对。而静态的训练分布无法跟上这种变化,形成所谓的分布瓶颈(distributional bottleneck):智能体在进步,训练数据却原地踏步。

来自 arXiv 的最新论文 《Adversarial Closed-Loop Curriculum for Evolving Role-Playing Agents》(arXiv:2609.28609,2026 年 9 月 23 日提交)提出了一个解法。作者包括 Zheng Zhang、Liu Liu、Qi Chai、Deheng Ye、Peilin Zhao、Mao Zheng、Hao Wang。

AdvRole:把"出题人"也变成学习对象

论文提出的框架名为 AdvRole,核心思路是把角色扮演的强化学习改造成一个闭环课程。它由两个角色交替训练:

  • Actor:负责学习如何扮演角色、完成对话;
  • Rewriter:负责改写角色设定与对话上下文,把它们变成专门针对当前 Actor 的"难题"。

关键在于 Rewriter 的训练信号。它使用一种性能差距奖励(performance-gap reward):如果改写后的场景能让当前 Actor 的得分相对于原始场景明显下降,就说明这次改写"难住了"智能体,因而获得更高奖励。

这样一来,场景池不再是静态的,而是随 Actor 能力同步演化,持续瞄准角色—上下文空间中尚未掌握的区域。这本质上是一种对抗式的自动出题机制:Actor 越强,Rewriter 出的题就越刁钻。

实验表现

论文在三个覆盖中英文的角色扮演基准上进行了评测,并额外发布了一个多语言基准。结果显示,AdvRole 在这些基准上持续优于各类基线方法。

为什么值得关注

这项工作的价值不止于角色扮演本身。它触及了 LLM 智能体训练中的一个普遍难题:如何让训练数据随模型能力自动升级。传统做法依赖人工标注或固定数据集,成本高且容易过时;而 AdvRole 用对抗生成的方式,把"数据生产"和"能力提升"耦合进同一个循环。

如果这一思路能推广到更广泛的任务领域——比如工具调用、多轮推理、代码生成——那么智能体的自我进化路径可能会变得更具可持续性。当然,Rewriter 本身的能力上限、以及对抗训练可能带来的不稳定性,仍是需要进一步观察的问题。

延伸阅读

  1. Proaction 借助 Codex 实现销售额增长 60%,每月节省 75+ 小时
  2. 五角大楼砸3000万美元打造AI测谎仪,专家为何称其「最糟糕的组合」?
  3. 五角大楼拟投3000万美元打造AI测谎仪,专家称方向错误
查看原文