AdaJEPA:世界模型不该冻住,边用边学才是正道
An Adaptive Latent World Model · NYU · arXiv 2606.32026
arXiv 2606.32026 · NYU · 2026-07-01
arxiv.org/abs/2606.32026
当前所有主流世界模型——JEPA、DINO-WM、Dreamer——都有一个共同的隐性假设:训练完成后模型就被冻住了,部署时只用来规划,不再更新。AdaJEPA 直指这个问题:世界模型应该像人一样,边行动边校准。核心思路极简——plan–act–adapt–replan,一个闭环。
AdaJEPA Plan-Act-Adapt-Replan Loop
AdaJEPA 的核心循环:用当前世界模型做 MPC 规划,执行第一个 action,拿到真实 observation,用这条 transition 做一步梯度更新,然后重新规划。

闭环自适应:每步一个梯度就够了

AdaJEPA 的循环是这样的:用当前世界模型做 MPC 规划 → 执行第一个 action → 拿到真实环境的 next observation → 用这个 transition 做 self-supervised 信号,跑一步梯度下降更新模型 → 用更新后的模型重新规划。

关键在于"一步"。不需要累积 buffer 做离线训练,不需要额外的专家数据,每个 MPC step 只用最新的一条 transition 做一次参数更新。更新目标是 latent prediction loss:让模型对刚发生的 (ot, at, ot+1) 的隐空间预测更准。

这个设计让学习和规划紧耦合:模型用预测选 action,action 的后果提供修正信号,修正后的模型预测更准,下一轮规划更靠谱。

离线训练照样用 JEPA 的标准配方

离线训练阶段没有任何花哨。还是 JEPA 那套:encoder 把高维观测压到隐空间,predictor 在隐空间里学 dynamics,训练数据是无 reward 的离线轨迹。ResNet 做全局特征,ViT 做局部 patch 特征,都试过了。

论文在三类环境上验证:PushT(推 T 形物体到目标位)、PushObj(多种形状物体推到目标位)、PointMaze(2D 迷宫导航)。MPC 规划器两种都用:gradient descent(GD)和 cross-entropy method(CEM)。

PushObj results across shapes
PushObj 上 7 种形状的规划成功率:AdaJEPA(绿色)在所有形状上一致优于冻结模型(蓝色),包括未见过的 square 和 smallT。

数据少了?自适应来补

最令人印象深刻的结果是训练数据稀缺场景。在 PushObj 上,只用一个形状的 1k 轨迹训练(极度匮乏),冻结模型的 seen shape 成功率只有 28.1%。加上 AdaJEPA 的 test-time adaptation 后,直接飙到 60.8%——翻倍还多。更夸张的是,这个 1k + adaptation 的组合,超过了用 16k 轨迹训练的冻结模型(43.5%)。

多样性比数量更重要:同样的 16k 总预算,分散到 4 个形状各 4k,比集中在一个形状 16k 效果更好——seen 81% vs 77%,unseen 52% vs 46%。

Training data scale vs success rate
训练数据规模 vs. 规划成功率:shape diversity K 和 trajectories per shape N。Test-time adaptation 在所有规模下一致提升,尤其在低数据 regime 下效果惊人。

鲁棒性:视觉偏移和动力学偏移都能扛

PushT 上做了视觉偏移实验(噪声、模糊、背景干扰、通道缺失),PushObj 上做了形状泛化(训练只见过 T/L/Z/+,测试遇到 square 和 smallT),PointMaze 上做了布局偏移和动力学偏移(改变摩擦和阻尼)。

PushT visual shift results
PushT 上五种视觉偏移的实验结果:AdaJEPA 在 GD 和 CEM 两种规划器下都显著优于冻结模型,每个 MPC step 仅增加 0.01–0.03 秒开销。

消融实验:只改 predictor,单步就够

Ablation studies
消融实验:只更新 predictor 就够了,encoder 的特征在训练阶段已经学得够好,主要需要修正的是 dynamics 预测。靠近输出的层收益最大。

规划轨迹可视化

下面的例子展示了冻结模型和 AdaJEPA 在相同起止条件下的规划轨迹。上半部分是 simulator 渲染的真实环境,下半部分是模型解码出的隐空间 rollout。AdaJEPA 通过持续精化模型预测,将物体成功推到目标位置;冻结模型则因预测漂移而失败。底部面板显示每个 replanning step 的 latent prediction loss——AdaJEPA 持续降低这个 loss。

PushObj Square shape example
Shape Shifts 示例:训练只见过 T/L/Z/+,测试未见过的 square。AdaJEPA 通过 test-time adaptation 成功完成任务。
PushT Red Anchor example
Visual Shifts 示例:PushT 上 pushed block 颜色从绿色变为红色。冻结模型因视觉偏移导致预测漂移而失败,AdaJEPA 持续校准后成功。

这跟 Orca / LoopWM 的关系

最近关注的 Orca(在线 RL 世界模型)和 LoopWM(循环世界模型)都从不同角度挑战了"冻结世界模型"这个范式。Orca 用在线 RL 在部署时持续训练整个模型,LoopWM 用循环迭代精化隐状态。

AdaJEPA 走的是第三条路:不做大规模在线训练(太贵),也不只改隐状态(不改参数),而是轻量级参数更新——一步梯度,只改 predictor,每步 0.01 秒。这个 trade-off 在工程落地性上最优:Orca 需要完整的训练 pipeline 在线跑,成本高;LoopWM 不改参数,表达能力受限;AdaJEPA 用最低成本获得最显著的收益。

工程意义

这篇论文的启示非常直接:任何要做 real-world 部署的世界模型系统,都应该把 test-time adaptation 作为标配而不是可选项。一步梯度、一条 transition、只改 predictor——这个方案的 overhead 几乎可以忽略,但带来的鲁棒性提升是数量级的。

对于 agent 系统设计来说,这进一步强化了一个原则:感知、预测、行动应该是持续校准的闭环,不是一次性训练完就封箱的流水线。