新上线今天0 投票
偏好条件化多目标强化学习:实现运行时可调的公交信号优先控制
公交信号优先(TSP)需要在多个相互竞争的目标之间取得平衡:减少公交延误的同时,限制对非公交交通的不利影响,并避免部分车辆出现极端等待。现有的基于强化学习(RL)的TSP方法通常编码公交感知特征(如载客量和时刻表偏差),但优化的是固定奖励或固定标量化,这限制了当机构优先级随一天中的时间或中断条件变化时的操作灵活性。
本研究提出了一种偏好条件化TSP控制器(π(a|s,w)),它能在最小/最大绿灯时间和过渡可行性约束下选择下一个信号相位,并可通过运行时偏好参数w进行调优,以权衡公交优先重点与整体交通延误,而无需重新训练。该控制器基于IntersectionZoo实现,引入了约束信号控制/TSP封装,并通过公交普及增强和基于时刻表的公交插入扩展了场景生成,以解决训练期间稀疏的公交优先事件。
实验对比了固定时间控制、基于规则的TSP覆盖和固定权重的PPO专家系统。结果表明,单个学习到的条件化策略在运行时偏好范围内形成了平滑的经验权衡前沿,优于固定时间和基于规则的基线,并保持了约束可行性。尾端延误诊断显示,非公交外部性在中等偏好设置下仍然有限,但在高公交优先权重下会显著增加。该研究已被第29届IEEE国际智能交通系统会议(ITSC 2026)接收,代码已开源。