SheepNav
新上线今天0 投票

面向热带商业建筑暖通空调控制的情境质量-多样性进化强化学习控制器

背景与挑战

在热带地区,商业建筑的暖通空调系统能耗巨大,如何实现高效控制一直是建筑节能领域的关键难题。传统控制方法往往依赖固定规则,难以适应多变的气候和负载条件。近年来,强化学习(RL)被引入建筑控制,但多数方法倾向于收敛到单一策略,无法兼顾不同运行场景下的最优表现。

创新方案:CQD-ERL

针对上述问题,研究者提出了一种名为 CQD-ERL(Contextual Quality-Diversity Evolutionary Reinforcement Learning)的新型控制器。其核心思想是不再追求单一策略,而是维护一个产品档案库,其中包含多个特化策略,每个策略针对特定的运行环境而优化。

具体而言,这些策略通过两个维度进行索引:

  • 数据驱动的运行情境:由每日天气和负荷模式的聚类结果定义,能够捕捉不同季节和天气条件下的运行特点。
  • 情境不变的行为描述符:描述策略的控制行为特征,确保策略的多样性。

这种设计使得控制器能够在面对不同环境时,快速选择最合适的策略,从而实现更精细的控制。

技术实现

CQD-ERL的构建融合了两种优化算子:

  • 梯度无关的进化算子:用于探索新的策略行为,增加策略多样性。
  • 软演员-评论家(SAC)策略梯度算子:用于精细调整策略,提升控制性能。

两者共享一个经验回放缓冲区,以提高样本效率。此外,所有动作在执行前都会经过一个确定性安全屏障的过滤,确保控制操作的安全性。

实验验证

研究者在一个代表新加坡商业建筑的两层降阶环境中训练该控制器,该环境模拟了潜在负荷、冷却塔逼近度和湿度约束。经过全年回测,与 ASHRAE Guideline 36 基线相比,CQD-ERL表现出色,证明了其在真实工况下的潜力。

意义与展望

这项研究为暖通空调控制提供了一种新的思路:通过质量-多样性(Quality-Diversity) 优化,而非单一策略优化,来应对复杂多变的建筑环境。这不仅有助于提升能源效率,也为其他领域的控制问题提供了借鉴。未来,该框架可进一步扩展至更多建筑类型和气候区域,推动智能建筑控制的发展。

延伸阅读

  1. 无权重微调:通过逻辑空间传输实现LLM个性化
  2. 突破性AI模型Forma:实现完整财务报表的长期预测
  3. 终端对称性作为决策资源:状态细化实现随时验证的构建
查看原文