论文解读 · When Does Continual Learning Require Learning · arXiv: 2607.07847 · UC Berkeley
持续学习领域二十年来的默认叙事是"灾难性遗忘"——学了B忘了A。UC Berkeley这篇直接推翻:持续学习应该是"在变化的世界中增加能力"。
论文把变化拆成两个正交轴:空间轴(领域漂移,domain shift)和时间轴(时序漂移,temporal drift),再加上第三维——改什么(context / 参数 / 外部记忆)。
三类更新机制、八种方法,统一切到同一评测管道:
四类评测场景,全部基于实际数据改造:领域漂移(ToolUse→FinQA→Bio)、事实更新(TempWiki逐月漂移2025.11-2026.02)、时序漂移(10-K年报2015-2020)、Agent状态(Gmail多步操作1-10步)。
提示方法(GEPA/ACE):学习快,覆盖性强。写好新prompt = 覆盖旧能力——后向遗忘(BWT)最严重。
蒸馏方法(SDFT):反向遗忘最小,知识积累最稳。但在事实更新场景,蒸馏保护机制反而阻止了必要的知识修正——双刃剑。
在线RL(SDPO/GRPO):在TempWiki事实更新上适应最快,但对奖励噪声极其敏感。GRPO对reward环境要求比SFT严格得多。
上下文压缩(Cartridges/TTT):提升推理效率,但不提升学习能力。记住更多 ≠ 学会更多——这是两个独立维度。
论文用实证回答了标题的问题:
别再拿"克服灾难性遗忘"当默认目标——很多场景下遗忘不是主要矛盾,更新速度 vs 更新稳定性的权衡才是。
蒸馏保护是双刃剑:需要更新时,同一机制会拖后腿。长上下文/KV压缩提升的是存取效率,不是学习能力。每次参数更新都是全局风险——能用context解决的别动weights。
对agent系统构建:运行时记忆(context/外部存储)和周期性权重更新不是对立的替代品,而是应该根据变化类型动态选择的互补机制。靠谱的agent要能判断"改prompt就够了"vs"得微调"——这正是前面Sleep范式(2606.03979)和Proactive Memory(2607.08716)的实证支撑。