AdaJEPA 的循环是这样的:用当前世界模型做 MPC 规划 → 执行第一个 action → 拿到真实环境的 next observation → 用这个 transition 做 self-supervised 信号,跑一步梯度下降更新模型 → 用更新后的模型重新规划。
关键在于"一步"。不需要累积 buffer 做离线训练,不需要额外的专家数据,每个 MPC step 只用最新的一条 transition 做一次参数更新。更新目标是 latent prediction loss:让模型对刚发生的 (ot, at, ot+1) 的隐空间预测更准。
这个设计让学习和规划紧耦合:模型用预测选 action,action 的后果提供修正信号,修正后的模型预测更准,下一轮规划更靠谱。
离线训练阶段没有任何花哨。还是 JEPA 那套:encoder 把高维观测压到隐空间,predictor 在隐空间里学 dynamics,训练数据是无 reward 的离线轨迹。ResNet 做全局特征,ViT 做局部 patch 特征,都试过了。
论文在三类环境上验证:PushT(推 T 形物体到目标位)、PushObj(多种形状物体推到目标位)、PointMaze(2D 迷宫导航)。MPC 规划器两种都用:gradient descent(GD)和 cross-entropy method(CEM)。
最令人印象深刻的结果是训练数据稀缺场景。在 PushObj 上,只用一个形状的 1k 轨迹训练(极度匮乏),冻结模型的 seen shape 成功率只有 28.1%。加上 AdaJEPA 的 test-time adaptation 后,直接飙到 60.8%——翻倍还多。更夸张的是,这个 1k + adaptation 的组合,超过了用 16k 轨迹训练的冻结模型(43.5%)。
多样性比数量更重要:同样的 16k 总预算,分散到 4 个形状各 4k,比集中在一个形状 16k 效果更好——seen 81% vs 77%,unseen 52% vs 46%。
PushT 上做了视觉偏移实验(噪声、模糊、背景干扰、通道缺失),PushObj 上做了形状泛化(训练只见过 T/L/Z/+,测试遇到 square 和 smallT),PointMaze 上做了布局偏移和动力学偏移(改变摩擦和阻尼)。
下面的例子展示了冻结模型和 AdaJEPA 在相同起止条件下的规划轨迹。上半部分是 simulator 渲染的真实环境,下半部分是模型解码出的隐空间 rollout。AdaJEPA 通过持续精化模型预测,将物体成功推到目标位置;冻结模型则因预测漂移而失败。底部面板显示每个 replanning step 的 latent prediction loss——AdaJEPA 持续降低这个 loss。
最近关注的 Orca(在线 RL 世界模型)和 LoopWM(循环世界模型)都从不同角度挑战了"冻结世界模型"这个范式。Orca 用在线 RL 在部署时持续训练整个模型,LoopWM 用循环迭代精化隐状态。
AdaJEPA 走的是第三条路:不做大规模在线训练(太贵),也不只改隐状态(不改参数),而是轻量级参数更新——一步梯度,只改 predictor,每步 0.01 秒。这个 trade-off 在工程落地性上最优:Orca 需要完整的训练 pipeline 在线跑,成本高;LoopWM 不改参数,表达能力受限;AdaJEPA 用最低成本获得最显著的收益。
这篇论文的启示非常直接:任何要做 real-world 部署的世界模型系统,都应该把 test-time adaptation 作为标配而不是可选项。一步梯度、一条 transition、只改 predictor——这个方案的 overhead 几乎可以忽略,但带来的鲁棒性提升是数量级的。
对于 agent 系统设计来说,这进一步强化了一个原则:感知、预测、行动应该是持续校准的闭环,不是一次性训练完就封箱的流水线。