AI Agent 记忆系统巡礼:4 种范式 + 1 张选择地图
TL;DR
Agent 长期记忆的设计不在”存什么”,在”谁来用、怎么用”:
- 反事实协作记忆 — Planner 主动检索失败经验重规划(适合多 Agent 协作任务)
- 工具图 episodic/procedural — 系统自动结构化成功轨迹(适合工具调用密集的 Agent)
- 不压缩子 Agent 路由 — 保留原始 chunk 由子 Agent 局部推理(适合长上下文多跳任务)
- 隐空间极简压缩 — RL 训练编码器压成 8 个 token(适合角色感知的多 Agent)
- 核心张力 — 压缩 vs 不压缩是哲学选择,不是工程优化
写给正在选型的工程师
“我们要不要给 Agent 加记忆?”——这是 2026 年下半年每个 Agent 团队都会问的问题。
前面几天我们刚写过 [AI Agent 系统巡礼:4 种架构范式] —— “Agent 系统有 4 种范式”。但范式定下来后,下一个问题马上出现:这 4 种范式各自需要什么样的记忆系统?
答案不是”用 vector DB + RAG”那么简单。2026 年 H1 出现 4 篇代表性论文,把 Agent 长期记忆拆成了 4 种根本不同的设计哲学。它们不是在”同一个问题上的不同解法”,而是在不同问题上的不同答案。
💡 Key Insight
评估 Agent 记忆系统的最好问题不是”它能存多少”,而是”谁来用、怎么用“——是 Planner 在失败后主动检索历史?还是系统自动结构化轨迹?还是子 Agent 按相关性激活?还是 RL 训练出极简编码?答案决定你用哪种范式。
4 种范式:一个选择框架
我把当前主流的 Agent 长期记忆设计分成 4 种范式。这个框架不来自任何权威,是我从 2026 H1 的 4 篇代表性论文中提炼出来的。
| 范式 | 记忆单元 | 决策单元 | 锚点论文 |
|---|---|---|---|
| 反事实协作记忆 | 失败经验 + 反事实 | Planner 显式检索 | EvoCF(ICML 2026) |
| 工具图双记忆 | 工具节点 + 调用关系 | 系统结构化抽取 | H-EPM(arXiv:2512.07287) |
| 不压缩子 Agent 路由 | 原始 episodic chunk | 子 Agent 按相关性激活 | E-mem(arXiv:2601.21714) |
| 隐空间极简压缩 | 约 8 个记忆 token | RL 训练编码器 | LatentMem(arXiv:2602.03036) |
这 4 种范式不是升级路径,是并列选项。你的任务可以同时运行在不同范式上——比如主任务用范式 4,调试辅助用范式 1。
范式 1:反事实协作记忆
你在这一阶段的特征
- 多 Agent 协作任务,一次规划不够用,需要”如果当时不这么选会怎样”的反事实推理
- 团队反复发现:失败经验没有被下次规划读到
- 已经在用 LangGraph / AutoGen 类框架,但缺少结构化记忆模块
核心问题
怎么让多 Agent 协作任务的失败经验”回灌”到下一次规划?
传统多 Agent 框架的记忆模块多是”摘要 + 向量检索”,但摘要会丢失关键失败细节,向量检索对反事实推理(”如果换种做法”)的支持很弱。
EvoCF 的答案是 Store–Consolidate–Retrieve 三段闭环:
- Store:每次规划执行后,把决策点 + 执行结果 + 失败原因作为 episodic 记录写入记忆库
- Consolidate:定期对失败经验做归纳,提取”什么决策模式下会出现什么失败”
- Retrieve:下一次规划前,Planner 主动检索相似失败案例,做反事实推理(What-if reasoning)后再决策
框架显式约束诱导器将失败经验回灌记忆,在协作任务中比 LLaMAR / MacNet 等传统多 Agent 基线的 planning success rate 显著提升。
范式 1 的退出条件
当你发现反事实推理的成本开始主导推理 latency,或 Planner 检索的失败经验越来越多导致 context 膨胀时,进入范式 2。
💡 Key Insight
EvoCF 的核心假设是:Multi-Agent 失败的主因不是规划不够聪明,是失败经验没有被下次规划读到。 这与 [Loop Engineering] 的 L4 Hill Climbing Loop 同源——后者是”读 trace 改 harness”,前者是”读 trace 改规划”。
范式 2:工具图双记忆
你在这一阶段的特征
- 单 Agent 多轮工具调用任务,工具库规模 10+
- 团队开始抱怨:”Agent 不知道什么时候该用哪个 tool”
- 想要”工具调用经验沉淀”,但不想为每个工具单独写规则
核心问题
怎么让 Agent 自动学会”何时用何 tool”,而不靠硬编码规则?
H-EPM 的答案是把成功工具调用轨迹压缩为工具图(tool graph):
- 节点 = tool
- 边 = 工具调用的先后关系(procedural 记忆)
- 同时保留情境(episodic)记忆
推理时,Agent 按当前状态相似度检索历史子图,引导下一步 tool call;RL 训练时,以历史成功转移做 reward shaping。
在多轮 API 调用与复杂工具链任务上,H-EPM 显著超越 ReAct / MemGPT 类基线。
范式 2 的退出条件
当工具库规模 >50 且角色开始分化(不只是工具调用,还涉及多角色协作)时,进入范式 3 或范式 4。
💡 Key Insight
H-EPM 的核心创新不是”压缩”——是”把轨迹压缩成图”。图结构让相似度检索从’语义相似’升级到’结构相似’,这是 procedural 记忆能 work 的关键。[agent-skills] 的”三层渐进式披露”也是同源思路——结构化的渐进披露优于扁平的元数据加载。
范式 3:不压缩子 Agent 路由
你在这一阶段的特征
- 长上下文多跳任务(文档 QA / 客服长对话 / 法律分析)
- 团队已经发现:摘要式记忆会丢失关键细节(lost-in-the-middle)
- 想要”原始信息保留 + 按需激活”
核心问题
当原始信息不能压缩时,怎么只把相关的部分喂给 LLM?
E-mem 的答案是反对纯 embedding 压缩记忆,保留原始情景块,由激活的子 Agent 做局部推理后再聚合:
- 保留原始 chunk:不做摘要,不压 embedding
- 记忆路由机制:按查询相关性激活不同 episodic chunk 对应的子 Agent
- 局部推理:每个子 Agent 只读自己负责的 chunk,做局部推理
- 聚合输出:最后由主 Agent 聚合子 Agent 的结论
在长对话与多跳 QA 任务上,记忆利用率与最终答案准确率均优于摘要式 / 向量式记忆基线。
范式 3 的退出条件
当任务规模超出子 Agent 调度成本,或需要跨任务长期记忆复用时,进入范式 4。
💡 Key Insight
E-mem 的核心假设是:压缩掉的不是上下文,是推理路径。 当 Agent 需要”回忆’当时我为什么这么判断’“时,原始 chunk 比摘要更有用。这与 [agent-skills] 的”反借口表格”哲学一致——保留原始证据比抽象总结更可靠。
范式 4:隐空间极简压缩
你在这一阶段的特征
- 多角色协作系统(不同 Agent 角色不同、专业不同)
- 团队发现:所有 Agent 共享扁平记忆导致专业信息错位
- 想要”角色感知 + 极简存储”
核心问题
当每个角色需要不同的记忆时,怎么用最少的 token 存下?
LatentMem 的答案是用 RL 训练的记忆编码器把交互压成少量记忆 token:
- Experience Bank 存原始轨迹(向量检索)
- 记忆编码器把交互压缩为约 8 个记忆 token
- 按角色生成差异化记忆向量
- LMPO 算法基于 RL 反向优化记忆提取策略
跨任务保持个位数到十数个百分点的性能提升,存储效率较传统方法显著提升(具体数字因任务而异)。
范式 4 的退出条件
💡 Key Insight
LatentMem 的核心反直觉:8 tokens 比 8K tokens 更准——因为后者是给所有人的,前者是给特定角色的。记忆系统的瓶颈不是存什么,是谁能用什么。 这是 [Context Engineering Field Guide] “context 是给谁的”问题的另一面。
选错范式的代价
很多团队会犯一个错误:用单一范式覆盖所有任务。
- 用范式 1(反事实)做日常客服 → Planner 检索成本爆炸
- 用范式 3(不压缩)做大规模工具调用 → 子 Agent 调度成本主导 latency
- 用范式 4(极简压缩)做多跳推理 → 8 tokens 装不下推理路径
更合理的混合是:
| 你的问题 | 范式 | 推荐入口 |
|---|---|---|
| “多 Agent 协作任务失败经验没用上” | 范式 1:反事实 | EvoCF |
| “Agent 不知道何时用何 tool” | 范式 2:工具图 | H-EPM |
| “摘要丢细节,子 Agent 能救” | 范式 3:不压缩 | E-mem |
| “多角色扁平记忆,专业信息错位” | 范式 4:极简压缩 | LatentMem |
重要:范式不是升级路径。 你的多跳推理用范式 3 最自然,工具调用用范式 2 最自然,硬要统一到范式 4 反而会让推理类任务性能下降。
结尾
Agent 长期记忆系统不是只有一种形态。它的形态由“谁来用、怎么用”决定。
范式 1(反事实协作)让 Planner 主动检索失败经验; 范式 2(工具图双记忆)让系统自动结构化轨迹; 范式 3(不压缩子 Agent)让子 Agent 按相关性激活原始 chunk; 范式 4(隐空间极简)让 RL 训练的编码器为每个角色生成 8 tokens 记忆。
每一种范式都有自己的核心假设与适用场景。没有”最好的记忆系统”,只有”适合你的记忆系统”。
读 4 篇锚点论文各 15 分钟(总共 60 分钟),比你乱试 3 个月高效得多。
💡 Key Insight
Agent 记忆系统选型的最常见错误是”追新不追适”——听说 LatentMem 很酷就把所有任务都上 8 tokens 压缩,结果推理路径被压扁,团队累死。先看任务匹配范式,再选实现。
延伸阅读
- AI Agent 系统巡礼:4 种架构范式 — 范式选择的母框架
- Loop Engineering — L4 Hill Climbing Loop 与范式 1 同源
- agent-skills 的反直觉设计 — 范式 2/3 的”反借口”哲学
- Context Engineering Field Guide — context 与 memory 的边界讨论
Published on 2026-07-02 深度阅读时间:约 8 分钟(4 篇论文合计约 60 分钟)
Agents and Multi-Agent 子系列 —— Agent 记忆系统
💬 评论
💡 使用 GitHub 账号登录 即可参与讨论