DecentMem:去中心化记忆拯救多智能体多样性

每个 agent 维护私有双池记忆,在线 learn explore-exploit 平衡,匹配 bandit 理论下界
Multi-Agent Memory 去中心化 Self-Evolution Bandit Theory arXiv 2605.22721
核心贡献:提出 DecentMem,首个去中心化多智能体记忆框架。每个 agent 维护私有双池记忆(利用池 + 探索池),由 LLM-as-a-judge 在线动态加权。理论证明全局可达性 + O(log T) 累积遗憾。15 组实验中 14 组最佳,比最强中心化基线平均高 8.6%,比无记忆高 26.1%,token 减少最多 49%。
14/15
实验组最佳
+23.8%
最大相对提升
-49%
Token 减少最多
O(log T)
累积遗憾上界

中心化记忆的三重毒害

多智能体系统(MAS)的记忆几乎都是中心化的:MetaGPT 的全局消息池、G-Memory 的层次化共享图——所有 agent 从同一个池子读写。DecentMem 的作者认为这是"错误的默认值",并给出了三个致命问题:

❌ 中心化记忆

  • 多样性坍缩:所有 agent 从同一池检索 → 行为趋同 → 系统退化为单策略
  • 协调税:并发读写需同步,开销随 agent 数线性增长
  • 隐私风险:一个 agent 的经验对所有 agent 可见

✅ DecentMem 去中心化

  • 多样性保持:经验私有,agent 保持角色互补性
  • 低开销:私有池无并发冲突,检索/更新高效
  • 隐私安全:经验不跨 agent 泄露

一个关键实验发现:协调随机性越高,去中心化的优势越大。在 Qwen3 系列上,从 AutoGen(预设工作流)到 DyLAN(部分随机)到 AgentNet(机会主义),DecentMem 对中心化基线的优势从 2.7% 扩大到 23.1%。这直接验证了核心论点——协调越不可预测,中心化记忆的同质化效应越严重。

双池记忆 + 在线路由

DecentMem 的核心设计是每个 agent 维护两个私有记忆池:

利用池(E-pool):存储已验证的成功轨迹。Agent 通过语义相似性匹配在 E-pool 中进行局部搜索,复用已知的好策略。E-pool 覆盖"已知好区域"——经验积累的价值在这里体现。

探索池(X-pool):存储 LLM 生成的候选策略,覆盖 agent 从未尝试过的策略空间。X-pool 注入"新区域的概率质量"——打破纯利用的局部最优陷阱。

两个池的组合是一个经典的 explore-exploit 问题,但 DecentMem 的关键创新在于在线加权:不是用固定 ε-greedy 或固定比例,而是由 LLM-as-a-judge 在每个推理阶段评估后动态调整 E-pool 和 X-pool 的贡献权重。相当于每个 agent 在运行时自己学习自己的探索-利用平衡。

消融实验证实了这个设计的必要性:

路由策略AgentNetDyLANAutoGen
在线加权(DecentMem)最佳最佳最佳
仅利用(α=1)-6.93%-3.51%-3.38%
仅探索(α=0)BBH 崩溃BBH 崩溃BBH 崩溃
固定 50/50最弱最弱最弱

值得注意的是"仅探索"在不同 benchmark 上表现差异极大——在 BBH(需要可复用结构的推理任务)上彻底崩溃,但在 AIME(新鲜数学推理)上仍有竞争力。这说明探索能力对新问题有效,但无法替代经验积累

理论保证

论文给出了两个理论结果,为经验观察提供解释:

全局可达性:E-pool 和 X-pool 的联合覆盖保证所有 agent 的联合策略空间都能被探索到。E-pool 覆盖已知好区域(基于已验证轨迹的邻域搜索),X-pool 注入覆盖(LLM 生成候选策略填充未访问区域)。两者互补确保没有可行解被遗漏。

O(log T) 累积遗憾:在线路由策略的累积遗憾与随机 bandit 的信息论下界只差常数因子。这意味着 DecentMem 的在线路由策略在信息效率上接近最优——每个 agent 学到足够快的 explore-exploit 平衡。

关键实验:Qwen3 系列

以下展示 Qwen3-4B 和 Qwen3-14B 在三个 MAS 框架上的核心结果(AIME 数学、MBPP-Plus 代码、ALFWorld 具身、BBH 推理):

框架记忆方法AIMEMBPPALFWorldBBH平均
Qwen3-4B
AgentNetNo memory13.3353.2046.1228.1335.20
MetaGPT8.3359.1450.4740.8639.70
ChatDev18.3356.4049.2333.6739.41
G-Memory10.0063.1852.1448.1443.37
DecentMem23.3367.5364.4559.4353.69
DyLANNo memory16.6754.7248.5441.1740.28
G-Memory18.3363.9352.3043.9744.63
DecentMem26.6764.5057.2552.1950.15
ChatDev21.6761.2348.5644.7344.05
Qwen3-14B
AgentNetNo memory26.6768.7266.2042.6151.05
G-Memory23.3371.2975.6168.5259.69
DecentMem41.6682.2783.5984.3072.95
ChatDev36.6776.7868.5048.9257.72
AutoGenNo memory30.0074.2181.5167.3363.26
G-Memory33.3385.2396.6989.2076.11
ChatDev33.3380.3694.8979.2871.97
DecentMem35.0084.7493.1390.5075.84

几个值得注意的模式:

Qwen3-4B + AgentNet 是 DecentMem 优势最大的场景——从无记忆的 35.2% 提升到 53.7%(+18.5pp,相对提升 52.5%)。在小模型 + 高随机性协调的组合下,中心化记忆的劣势暴露得最彻底。

Qwen3-14B + AgentNet 上 DecentMem 在 BBH 达到 84.3%,比 G-Memory 的 68.5% 高出 15.8pp。这个差距在推理任务上尤为显著——中心化记忆让 agent 陷入相似的推理路径,而私有记忆让不同 agent 发展出互补的推理策略。

Figure 3: Cumulative Accuracy
图 3:MBPP-Plus 上的累积准确率曲线。DecentMem(紫色)在三个 MAS 框架上都更快收敛到更高准确率,尤其在 DyLAN 上收敛速度约 2.5× 快于中心化基线。

成本分析:Token 减半

在 BBH benchmark 上(Qwen3-8B),DecentMem 在三个框架上都位于"性能-成本"帕累托前沿的左上角——最高准确率 + 最低 token 成本。token 消耗减少的原因直观:私有记忆池比共享池更小、更聚焦,agent 只检索与自己角色相关的经验,避免了共享池中大量无关记忆的检索开销。

具体数据:在 AgentNet 上 token 从 G-Memory 的 ~5.5×10⁸ 降到 DecentMem 的 ~2.1×10⁸(-62%);在 DyLAN 上从 ~3.9×10⁸ 降到 ~3.9×10⁸(持平);在 AutoGen 上从 ~5.5×10⁸ 降到 ~2.1×10⁸(-62%)。

与 DeLM 的对照

这篇论文与 DeLM(arXiv 2606.10662)形成了天然互补:

维度DeLMDecentMem
解决的问题协调机制的去中心化记忆存储的去中心化
核心机制共享已验证上下文 + 任务队列私有双池记忆 + 在线路由
共享策略共享上下文(但验证后写入)完全私有,不跨 agent
目标 benchmarkSWE-bench, LongBenchAIME, MBPP, ALFWorld, BBH
理论支撑无(纯工程)全局可达性 + O(log T) 遗憾

两者指向同一方向:在多智能体系统中,去中心化不是妥协,而是更高效的默认选项。一个有趣的未来方向是两者结合——用 DecentMem 的私有双池作为 DeLM 框架中每个 agent 的本地记忆,同时保留 DeLM 的共享验证上下文作为"公告栏"。私有记忆保持多样性,共享上下文保证基本协调,验证写入防止信息污染。

评价

DecentMem 的贡献不仅在性能数字——更重要的是它动摇了一个根深蒂固的默认假设:多智能体应该共享记忆。论文用实证和理论双重证据说明,共享记忆带来的同质化效应足以抵消其信息共享的好处。

双池记忆 + 在线路由的设计本身并不复杂,但论文的实验设计非常扎实:5 个 benchmark × 3 个 MAS 框架 × 5 个 backbone = 75 组实验,加上消融、自演化曲线和成本分析,结论的可信度高。

一个值得注意的局限:论文假设 agent 之间可以通过任务分配机制实现间接协调(通过 MAS 框架),但记忆完全私有。在需要 agent 之间直接共享经验的场景下(如跨 agent 的技能迁移),DecentMem 的设计可能需要扩展——比如允许经过验证的"技能片段"在 agent 之间有条件共享。