新上线今天0 投票
面向热带商业建筑暖通空调控制的情境质量-多样性进化强化学习控制器
背景与挑战
在热带地区,商业建筑的暖通空调系统能耗巨大,如何实现高效控制一直是建筑节能领域的关键难题。传统控制方法往往依赖固定规则,难以适应多变的气候和负载条件。近年来,强化学习(RL)被引入建筑控制,但多数方法倾向于收敛到单一策略,无法兼顾不同运行场景下的最优表现。
创新方案:CQD-ERL
针对上述问题,研究者提出了一种名为 CQD-ERL(Contextual Quality-Diversity Evolutionary Reinforcement Learning)的新型控制器。其核心思想是不再追求单一策略,而是维护一个产品档案库,其中包含多个特化策略,每个策略针对特定的运行环境而优化。
具体而言,这些策略通过两个维度进行索引:
- 数据驱动的运行情境:由每日天气和负荷模式的聚类结果定义,能够捕捉不同季节和天气条件下的运行特点。
- 情境不变的行为描述符:描述策略的控制行为特征,确保策略的多样性。
这种设计使得控制器能够在面对不同环境时,快速选择最合适的策略,从而实现更精细的控制。
技术实现
CQD-ERL的构建融合了两种优化算子:
- 梯度无关的进化算子:用于探索新的策略行为,增加策略多样性。
- 软演员-评论家(SAC)策略梯度算子:用于精细调整策略,提升控制性能。
两者共享一个经验回放缓冲区,以提高样本效率。此外,所有动作在执行前都会经过一个确定性安全屏障的过滤,确保控制操作的安全性。
实验验证
研究者在一个代表新加坡商业建筑的两层降阶环境中训练该控制器,该环境模拟了潜在负荷、冷却塔逼近度和湿度约束。经过全年回测,与 ASHRAE Guideline 36 基线相比,CQD-ERL表现出色,证明了其在真实工况下的潜力。
意义与展望
这项研究为暖通空调控制提供了一种新的思路:通过质量-多样性(Quality-Diversity) 优化,而非单一策略优化,来应对复杂多变的建筑环境。这不仅有助于提升能源效率,也为其他领域的控制问题提供了借鉴。未来,该框架可进一步扩展至更多建筑类型和气候区域,推动智能建筑控制的发展。