告别目标依赖:JEPA 框架实现偏微分方程的无目标预测控制
导读
在控制偏微分方程(PDE)时,传统方法通常需要一个明确的目标(如跟踪特定轨迹或达到某个状态),并在训练中反复调整模型。但一篇来自 arXiv 的新论文提出了一种**目标无关(goal-agnostic)**的方法,让世界模型在无奖励、无下游目标的情况下离线学习,之后冻结模型,再通过规划器灵活适配不同控制任务。这一思路有望降低对标注数据的依赖,提升模型的复用性。
核心方法:联合嵌入预测架构(JEPA)
研究团队构建了一个基于联合嵌入预测架构(JEPA)的控制框架。核心是一个小型 2D ViT 编码器和一个动作条件化的潜在动力学模型。训练阶段完全离线,不涉及任何奖励函数或下游控制目标,仅通过预测潜在空间的未来状态来学习 PDE 的演化规律。训练完成后,模型被冻结,不再更新。
在控制阶段,团队使用**模型预测路径积分(MPPI)**控制器,在冻结的潜在动力学模型上进行规划。关键发现是:控制目标最好应用于显式的物理可观测量(如动能),而不是直接在潜在空间最小化欧氏距离(L2)。只要可观测量满足唯一延拓(injectivity)性质,就能更准确地引导系统到达目标状态。
实验验证:Navier-Stokes 基准测试
在 PDE Control Gym 的 2D Navier-Stokes 基准上,团队对比了两种规划策略:
- 潜在 L2 规划:直接在潜在空间最小化预测与目标的 L2 距离。
- 动能探针(KE-probe)规划:通过学习一个线性探针从潜在状态中解码出动能(kinetic energy),然后以动能为优化目标。
结果如下:
- 本机奖励(native reward):KE 规划在 50 个 episode 上的平均奖励为 -10.90±0.91,优于潜在 L2 规划的 -12.08±0.86(95% 置信区间)。
- 速度场 RMSE:最后四分之一时间步的 RMSE 从 0.0765 降至 0.0692。
泛化能力:应对未见过目标
为了测试泛化性,研究者设计了三个刻意不同、非周期性的目标,这些目标在训练中从未出现过。冻结的模型配合 KE 探针规划,在 30 个配对 episode 中全部获胜,最终场 RMSE 降低了 53%(0.0220 vs 0.0469)。
此外,同一冻结模型还能通过直接调节动能来实现稳定控制:围绕稳态配置进行调节,达到 2.7% 的平均相对误差。
局限与展望
论文也指出,潜在探针(KE 探针)对测量噪声和缺失像素较为敏感。尽管如此,研究者认为结果支持一个观点:潜在动力学可以保持动态且目标无关,而经过标定的可观测量(只要保证唯一延拓)可能是状态控制的更好目标。
小结
这项研究展示了目标无关的联合嵌入预测控制在 PDE 上的可行性。通过离线训练一个冻结的世界模型,再配合合适的物理探针,模型能够灵活适应多种控制任务,包括轨迹跟踪和稳定控制。对于机器人、流体控制等连续物理系统的控制问题,这种范式或许能提供更高效、更通用的解决方案。