TL;DR

Agent 长期记忆的设计不在”存什么”,在”谁来用、怎么用”:

  1. 反事实协作记忆 — Planner 主动检索失败经验重规划(适合多 Agent 协作任务)
  2. 工具图 episodic/procedural — 系统自动结构化成功轨迹(适合工具调用密集的 Agent)
  3. 不压缩子 Agent 路由 — 保留原始 chunk 由子 Agent 局部推理(适合长上下文多跳任务)
  4. 隐空间极简压缩 — RL 训练编码器压成 8 个 token(适合角色感知的多 Agent)
  5. 核心张力 — 压缩 vs 不压缩是哲学选择,不是工程优化

写给正在选型的工程师

“我们要不要给 Agent 加记忆?”——这是 2026 年下半年每个 Agent 团队都会问的问题。

前面几天我们刚写过 [AI Agent 系统巡礼:4 种架构范式] —— “Agent 系统有 4 种范式”。但范式定下来后,下一个问题马上出现:这 4 种范式各自需要什么样的记忆系统?

答案不是”用 vector DB + RAG”那么简单。2026 年 H1 出现 4 篇代表性论文,把 Agent 长期记忆拆成了 4 种根本不同的设计哲学。它们不是在”同一个问题上的不同解法”,而是在不同问题上的不同答案

💡 Key Insight

评估 Agent 记忆系统的最好问题不是”它能存多少”,而是”谁来用、怎么用“——是 Planner 在失败后主动检索历史?还是系统自动结构化轨迹?还是子 Agent 按相关性激活?还是 RL 训练出极简编码?答案决定你用哪种范式。

4 种范式:一个选择框架

我把当前主流的 Agent 长期记忆设计分成 4 种范式。这个框架不来自任何权威,是我从 2026 H1 的 4 篇代表性论文中提炼出来的。

范式 记忆单元 决策单元 锚点论文
反事实协作记忆 失败经验 + 反事实 Planner 显式检索 EvoCF(ICML 2026)
工具图双记忆 工具节点 + 调用关系 系统结构化抽取 H-EPM(arXiv:2512.07287
不压缩子 Agent 路由 原始 episodic chunk 子 Agent 按相关性激活 E-mem(arXiv:2601.21714
隐空间极简压缩 约 8 个记忆 token RL 训练编码器 LatentMem(arXiv:2602.03036

这 4 种范式不是升级路径,是并列选项。你的任务可以同时运行在不同范式上——比如主任务用范式 4,调试辅助用范式 1。

范式 1:反事实协作记忆

你在这一阶段的特征

  • 多 Agent 协作任务,一次规划不够用,需要”如果当时不这么选会怎样”的反事实推理
  • 团队反复发现:失败经验没有被下次规划读到
  • 已经在用 LangGraph / AutoGen 类框架,但缺少结构化记忆模块

核心问题

怎么让多 Agent 协作任务的失败经验”回灌”到下一次规划?

传统多 Agent 框架的记忆模块多是”摘要 + 向量检索”,但摘要会丢失关键失败细节,向量检索对反事实推理(”如果换种做法”)的支持很弱。

EvoCF 的答案是 Store–Consolidate–Retrieve 三段闭环

  • Store:每次规划执行后,把决策点 + 执行结果 + 失败原因作为 episodic 记录写入记忆库
  • Consolidate:定期对失败经验做归纳,提取”什么决策模式下会出现什么失败”
  • Retrieve:下一次规划前,Planner 主动检索相似失败案例,做反事实推理(What-if reasoning)后再决策

框架显式约束诱导器将失败经验回灌记忆,在协作任务中比 LLaMAR / MacNet 等传统多 Agent 基线的 planning success rate 显著提升。

范式 1 的退出条件

当你发现反事实推理的成本开始主导推理 latency,或 Planner 检索的失败经验越来越多导致 context 膨胀时,进入范式 2。

💡 Key Insight

EvoCF 的核心假设是:Multi-Agent 失败的主因不是规划不够聪明,是失败经验没有被下次规划读到。 这与 [Loop Engineering] 的 L4 Hill Climbing Loop 同源——后者是”读 trace 改 harness”,前者是”读 trace 改规划”。

范式 2:工具图双记忆

你在这一阶段的特征

  • 单 Agent 多轮工具调用任务,工具库规模 10+
  • 团队开始抱怨:”Agent 不知道什么时候该用哪个 tool”
  • 想要”工具调用经验沉淀”,但不想为每个工具单独写规则

核心问题

怎么让 Agent 自动学会”何时用何 tool”,而不靠硬编码规则?

H-EPM 的答案是把成功工具调用轨迹压缩为工具图(tool graph)

  • 节点 = tool
  • = 工具调用的先后关系(procedural 记忆)
  • 同时保留情境(episodic)记忆

推理时,Agent 按当前状态相似度检索历史子图,引导下一步 tool call;RL 训练时,以历史成功转移做 reward shaping。

在多轮 API 调用与复杂工具链任务上,H-EPM 显著超越 ReAct / MemGPT 类基线。

范式 2 的退出条件

当工具库规模 >50 且角色开始分化(不只是工具调用,还涉及多角色协作)时,进入范式 3 或范式 4。

💡 Key Insight

H-EPM 的核心创新不是”压缩”——是”把轨迹压缩成图”。图结构让相似度检索从’语义相似’升级到’结构相似’,这是 procedural 记忆能 work 的关键。[agent-skills] 的”三层渐进式披露”也是同源思路——结构化的渐进披露优于扁平的元数据加载。

范式 3:不压缩子 Agent 路由

你在这一阶段的特征

  • 长上下文多跳任务(文档 QA / 客服长对话 / 法律分析)
  • 团队已经发现:摘要式记忆会丢失关键细节(lost-in-the-middle)
  • 想要”原始信息保留 + 按需激活”

核心问题

当原始信息不能压缩时,怎么只把相关的部分喂给 LLM?

E-mem 的答案是反对纯 embedding 压缩记忆,保留原始情景块,由激活的子 Agent 做局部推理后再聚合:

  • 保留原始 chunk:不做摘要,不压 embedding
  • 记忆路由机制:按查询相关性激活不同 episodic chunk 对应的子 Agent
  • 局部推理:每个子 Agent 只读自己负责的 chunk,做局部推理
  • 聚合输出:最后由主 Agent 聚合子 Agent 的结论

在长对话与多跳 QA 任务上,记忆利用率与最终答案准确率均优于摘要式 / 向量式记忆基线。

范式 3 的退出条件

当任务规模超出子 Agent 调度成本,或需要跨任务长期记忆复用时,进入范式 4。

💡 Key Insight

E-mem 的核心假设是:压缩掉的不是上下文,是推理路径。 当 Agent 需要”回忆’当时我为什么这么判断’“时,原始 chunk 比摘要更有用。这与 [agent-skills] 的”反借口表格”哲学一致——保留原始证据比抽象总结更可靠

范式 4:隐空间极简压缩

你在这一阶段的特征

  • 多角色协作系统(不同 Agent 角色不同、专业不同)
  • 团队发现:所有 Agent 共享扁平记忆导致专业信息错位
  • 想要”角色感知 + 极简存储”

核心问题

当每个角色需要不同的记忆时,怎么用最少的 token 存下?

LatentMem 的答案是用 RL 训练的记忆编码器把交互压成少量记忆 token

  • Experience Bank 存原始轨迹(向量检索)
  • 记忆编码器把交互压缩为约 8 个记忆 token
  • 按角色生成差异化记忆向量
  • LMPO 算法基于 RL 反向优化记忆提取策略

跨任务保持个位数到十数个百分点的性能提升,存储效率较传统方法显著提升(具体数字因任务而异)。

范式 4 的退出条件

💡 Key Insight

LatentMem 的核心反直觉:8 tokens 比 8K tokens 更准——因为后者是给所有人的,前者是给特定角色的。记忆系统的瓶颈不是存什么,是谁能用什么。 这是 [Context Engineering Field Guide] “context 是给谁的”问题的另一面。

选错范式的代价

很多团队会犯一个错误:用单一范式覆盖所有任务。

  • 用范式 1(反事实)做日常客服 → Planner 检索成本爆炸
  • 用范式 3(不压缩)做大规模工具调用 → 子 Agent 调度成本主导 latency
  • 用范式 4(极简压缩)做多跳推理 → 8 tokens 装不下推理路径

更合理的混合是:

你的问题 范式 推荐入口
“多 Agent 协作任务失败经验没用上” 范式 1:反事实 EvoCF
“Agent 不知道何时用何 tool” 范式 2:工具图 H-EPM
“摘要丢细节,子 Agent 能救” 范式 3:不压缩 E-mem
“多角色扁平记忆,专业信息错位” 范式 4:极简压缩 LatentMem

重要:范式不是升级路径。 你的多跳推理用范式 3 最自然,工具调用用范式 2 最自然,硬要统一到范式 4 反而会让推理类任务性能下降。

结尾

Agent 长期记忆系统不是只有一种形态。它的形态由“谁来用、怎么用”决定。

范式 1(反事实协作)让 Planner 主动检索失败经验; 范式 2(工具图双记忆)让系统自动结构化轨迹; 范式 3(不压缩子 Agent)让子 Agent 按相关性激活原始 chunk; 范式 4(隐空间极简)让 RL 训练的编码器为每个角色生成 8 tokens 记忆。

每一种范式都有自己的核心假设与适用场景。没有”最好的记忆系统”,只有”适合你的记忆系统”。

读 4 篇锚点论文各 15 分钟(总共 60 分钟),比你乱试 3 个月高效得多。

💡 Key Insight

Agent 记忆系统选型的最常见错误是”追新不追适”——听说 LatentMem 很酷就把所有任务都上 8 tokens 压缩,结果推理路径被压扁,团队累死。先看任务匹配范式,再选实现。


延伸阅读

  1. AI Agent 系统巡礼:4 种架构范式 — 范式选择的母框架
  2. Loop Engineering — L4 Hill Climbing Loop 与范式 1 同源
  3. agent-skills 的反直觉设计 — 范式 2/3 的”反借口”哲学
  4. Context Engineering Field Guide — context 与 memory 的边界讨论

Published on 2026-07-02 深度阅读时间:约 8 分钟(4 篇论文合计约 60 分钟)

Agents and Multi-Agent 子系列 —— Agent 记忆系统