AutoMem 的核心设计极简:把文件系统操作(read、write、search、append、create)提升为和任务动作(移动、攻击、合成)同等地位的动作。模型在同一次 forward pass 里,既可以选择"向北走",也可以选择追加内容到笔记里。每个记忆决策都是可追踪的动作,完整记录在轨迹中。
这看似简单,但把记忆从"架构模块"变成了"行为技能"。传统 RAG、scratchpad、summary buffer 都是预设的固定机制——系统决定了怎么记,模型只能被动使用。AutoMem 让模型自己决定记什么、什么时候查、怎么组织。
记忆技能沿两个轴提升:结构(scaffolding)和熟练度(proficiency)。但长时任务里,一个 episode 可以跑上万个 step,一个记忆错误可能隐藏几千步才暴露——人类根本没法审查完整轨迹。
AutoMem 的解法是用一个更强的 LLM(meta-LLM)充当"代码审查者",通过两个外循环自动化这两个轴的优化。
循环一:结构优化。 meta-LLM(Claude Opus 4.6)读取完整的 agent 轨迹,诊断记忆使用的失败模式,然后迭代修改 agent 的代码、prompt 和记忆文件 schema。比如在 Crafter 游戏里,meta-LLM 发现 agent 反复尝试不可能的合成操作,就在 scaffold 里加了一个材质检查门——合成前先验证是否拥有所需材料,否则阻止动作。Crafter 经过 5 轮迭代,MiniHack 4 轮,NetHack 2 轮。
循环二:熟练度训练。 在最终 scaffold 上跑大量 episode,meta-LLM(Claude Opus 4.7)从轨迹中筛选"好的记忆决策"作为监督数据,用 LoRA 微调一个专门的 memory specialist。关键是只训练记忆操作部分,不动任务动作的模型权重——通过两个模型实例共享对话历史的方式部署。这保证了记忆技能的提升不会损害已有的任务执行能力。
结果令人印象深刻。用 Qwen2.5-32B-Instruct 作为 base model,只优化记忆(完全不动任务动作的权重),三个程序化生成的长时游戏上获得 2x–4x 的提升:Crafter 25%→51.4%,MiniHack 7.5%→30%,NetHack 0.42%→1.85%。
更关键的是对标:优化后的 32B 模型大幅超越 Qwen2.5-72B,达到 Claude Opus 4.5 和 Gemini 3.1 Pro Thinking 的水平。这意味着在长时任务上,良好的记忆管理比模型规模更有效。
| Agent | Crafter (%) | MiniHack (%) | NetHack (%) |
|---|---|---|---|
| 前沿闭源模型 | |||
| Gemini-3.1-Pro-Thinking | 55.0 | 27.5 | 2.6 |
| Claude-Opus-4.5 | 49.5 | 27.5 | 2.0 |
| 开源模型 | |||
| DeepSeek-R1 (671B) | 36.4 | 25.0 | 1.4 |
| Qwen2.5-72B-Instruct | 27.3 | 5.0 | 0.3 |
| AutoMem (Qwen2.5-32B) | |||
| base (v0) | 25.0 | 7.5 | 0.42 |
| + scaffold opt. | 47.27 | 27.5 | 1.57 |
| + memory training | 51.36 | 30.0 | 1.85 |
AutoMem 最重要的洞见不是技术上的,而是观念上的:记忆管理是一种独立可学的技能,和推理、规划一样值得被专门训练。
这和当前 agent 框架(OpenClaw 等)的做法形成了鲜明对比。大部分框架的记忆是预设架构——代码决定了怎么存、怎么取。AutoMem 提出的问题是:如果让模型自己学怎么管理记忆,效果会不会更好?答案是肯定的,而且提升幅度远超预期。
第二个启示是 meta-LLM 驱动的自动化优化。长时任务的轨迹审查是人类无法完成的,但 Claude Opus 4.6/4.7 可以读取上万步的完整轨迹并给出精确的诊断和修改建议。这实际上是一种"LLM 做 LLM 的 system engineer"的模式——用更强的模型来优化 agent 的非参数组件(代码、prompt、数据选择)。
局限也很明显:当前记忆是 episodic 的(每次 episode 重置),不支持跨 episode 的持久记忆;只在游戏环境验证;每个环境需要独立优化 scaffold。但从 32B 撑到 frontier 级别这个结果,足以说明记忆技能的杠杆率有多高。