Agent的"健忘症"该怎么治?
Meta提出主动记忆Agent,让长程任务不再丢状态

论文解读:Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents (arXiv: 2607.08716)

核心观点:长程Agent的失败往往不是因为"记不住",而是记忆虽然还在context里,却不再影响决策。Meta AI提出将记忆重新定义为主动干预策略——一个独立的记忆Agent管理结构化状态库,并精准选择何时介入执行Agent的决策流。在Terminal-Bench和τ²-Bench上带来+6.8~8.3pp的提升。

行为状态衰减:一个被忽视的致命缺陷

LLM Agent在多步任务中经常出现这种失败模式:Agent在第五步发现了一个关键信息(比如某命令不能用、某API有限制),但到了第三十步完全遗忘,重新踩同一个坑。信息可能还在context window内,但不再驱动行为。

Meta的团队把这种现象命名为行为状态衰减(Behavioral State Decay)。这个区分很关键:很多memory系统关注"能不能存和检索",但本论文指出更本质的问题是——记忆什么时候应该介入控制流?

记忆即干预:两阶段架构

核心思路:记忆不是存储问题,而是干预问题。一个独立的记忆Agent与执行Agent并行运行,完全不修改执行Agent。

System Architecture
图1:记忆干预架构总览。记忆Agent作为独立进程运行,通过两阶段工作流管理记忆并决定是否干预。

第一阶段:结构化记忆管理。通过预定义工具调用来维护三部分记忆库——

第二阶段:选择性干预。基于更新后的记忆库,记忆Agent要么发出精准提醒注入到执行Agent的下一次调用,要么选择沉默。沉默是显式决策——过多干预反而干扰局部进度。

Memory Agent Internals
记忆Agent内部工作流:Phase 1管理记忆库,Phase 2决定是否干预。

消融实验:选择性干预的价值

在τ²-Bench上用Sonnet 4.5作为执行Agent的消融结果:

配置记忆管理干预方式Macro平均
完整记忆Agent(本文)结构化管理选择性提醒/沉默64.3%
被动暴露全部记忆结构化管理全部暴露61.5%
每步强制注入结构化管理必须提醒63.5%
无记忆库纯指导跳过advisor式指导61.0%
Mem0通用记忆Mem0 ADD向量+BM25检索62.1%

关键发现:被动暴露全部记忆不如选择性干预(-2.8pp);纯advisor指导在某些领域甚至低于baseline;每步强制注入在macro平均上不如选择性沉默。干预校准本身是需要学习的策略。

主实验结果

用Claude Opus 4.6作为记忆Agent,两种执行Agent的pass@1提升:

Benchmark执行AgentBaseline+Memory提升
Terminal-Bench 2.0Sonnet 4.537.6%45.9%+8.3pp
Terminal-Bench 2.0Opus 4.643.5%45.9%+2.4pp
τ²-Bench (加权)Sonnet 4.555.0%61.8%+6.8pp
τ²-Bench (加权)Opus 4.666.2%68.7%+2.5pp

弱模型增益更大,但强模型仍有提升——收益不只是弥补能力不足。

开源记忆策略的初步探索

用SETA数据集对Qwen3.5-27B做SFT+GRPO训练。SFT教会接口和基本纪律(精炼写入、更新过期状态),GRPO进一步校准干预时机。验证集reward有提升,且能部分迁移到Terminal-Bench。记忆干预策略可以被蒸馏到开源模型中。

启示:旁路Agent范式

这篇论文提出了一种通用的"旁路Agent"范式——用独立的、有明确职责边界的Agent处理执行Agent的某个维度,而不修改执行Agent本身。这种关注点分离的工程哲学,比把所有能力塞进一个模型要实用得多。对OpenClaw这类multi-channel agent gateway来说,记忆管理完全可以作为独立模块plug-and-play接入。