MIA:让 Agent 在推理过程中实时进化——双重记忆系统的闭环
TL;DR
本文核心观点:
- MIA 的双重记忆系统是最大亮点 — 非参数记忆负责沉淀经验,参数记忆负责吸收能力,二者通过双向转换环路形成持续进化的闭环
- 测试时学习打破了训练-推理的界限 — Planner 的参数更新在推理过程中实时完成,不中断流程,面对全新领域也能边做边学
- 小模型也能通过记忆进化逼近大模型 — GPT-5.4 在 LiveVQA/HotpotQA 提升 9%/6%,Qwen2.5-VL-7B 平均提升 31%,框架对不同规模模型都有普适增益
一个长期被忽视的问题
做深度研究任务的 Agent,有一个被谈论得很少但极其普遍的问题:
它不记得自己是怎么走到这一步的。
上下文窗口再长,也只是把「做过什么」罗列出来。Agent 能记住「上一轮搜了什么关键词」,但它不会把「这个搜索策略在这个领域效果好」这件事,变成下一次的规划能力。
换句话说:大多数 Agent 的记忆是「陈述性」的,不是「程序性」的。它记住了事实,但没有把经验转化为能力。
这是 memory 和 intelligence 之间的一道沟。MIA(Memory Intelligence Agent,arXiv:2604.04503)想填平这道沟。
MIA 的三重架构
MIA 采用 Manager-Planner-Executor 三层架构,每一层对应不同的认知职责:
Manager(记忆管理员)
非参数化记忆系统。负责整理和压缩历史搜索轨迹,把碎片化的行为记录沉淀为结构化的经验。
Manager 的输出不是「某年某月搜了什么」,而是「在 X 类问题上,Y 策略是有效的」。这是一种元认知级别的信息压缩。
Planner(规划师)
参数化记忆智能体。根据 Manager 沉淀的经验制定行动计划。
Planner 是整个框架的学习核心——它的参数会随着任务执行而更新,会把 Manager 的经验「内化」为自身的规划能力。
Executor(执行者)
在 Planner 的搜索计划指导下执行具体的信息搜索与分析操作。
Executor 的职责是清晰的:执行,但不决策。决策权归 Planner,信息整理权归 Manager。
核心机制:双重记忆的闭环进化
MIA 最大的创新不是三层架构本身,而是双重记忆系统的双向转换环路:
非参数记忆 → 参数记忆:Manager 整理的经验,通过某种形式的信息注入,被 Planner 吸收为参数化的能力。这意味着「做过什么」真正变成了「能做什么」。
参数记忆 → 非参数记忆:Planner 在执行过程中产生的失败模式和改进方向,又会反馈回 Manager,形成新的经验沉淀。
这个环路一旦跑通,Agent 就不再是每次任务从零开始,而是每次任务结束后都比进入时更强。
传统 Agent 的学习曲线是平的。MIA 的学习曲线是指数的——理论上。
测试时学习:推理过程中的实时进化
最反直觉的设计是:MIA 的 Planner 参数更新发生在推理过程中。
传统范式:训练时学习 → 推理时使用固定参数。这是封闭环。
MIA 的范式:训练时预学习 → 推理时继续学习 → 每次任务后能力更新。这是开放环。
测试时学习(test-time learning)的核心价值在于:Agent 面对全新领域时,不需要依赖预训练阶段的知识储备,可以边做边学,在任务执行过程中实时完善 Planner。
这相当于把「适应新任务」的成本,从「重新训练」变成了「几个额外推理步骤」。
实验结果:不同规模模型均有增益
MIA 的框架在不同规模的模型上都验证了有效性:
| 模型 | 基准 | 提升幅度 |
|---|---|---|
| GPT-5.4 | LiveVQA | +9% |
| GPT-5.4 | HotpotQA | +6% |
| Qwen2.5-VL-7B | 多基准平均 | +31% |
Qwen2.5-VL-7B 这种轻量级模型获得 31% 的平均提升,说明 MIA 框架对模型规模的依赖不是线性的——结构性的记忆进化机制可以弥补参数量的差距。
这是「小模型 + 好框架」胜过大模型 + 差框架的一个有力证据。
对 Agent 设计的意义
MIA 带来的最大思维转变是:记忆系统不应该只是存储层,而应该是学习层。
传统设计里,记忆是给上下文补洞的——上下文不够长,所以需要 memory store。这是被动架构。
MIA 的设计里,记忆是主动的学习通道——经验通过 Manager 沉淀,能力通过 Planner 内化,执行通过 Executor 落地。这是主动架构。
另一个值得注意的点:Manager 是非参数的。这意味着经验沉淀不需要梯度更新,不需要重新训练,只需要在记忆系统层面做更好的信息压缩和结构化。这是一个工程上相对容易落地的组件。
局限与开放问题
MIA 揭示了记忆进化的重要性,但也留下了几个未回答的问题:
环路稳定性:双重记忆的双向转换,在长期运行中会不会出现误差累积?Manager 的经验压缩是否有损?Planner 吸收经验的机制是否可靠?
遗忘机制:MIA 讲了如何积累经验,但没有讲如何处理过时经验。真实世界中,某些经验的时效性很短,过度记忆和记忆不足一样有害。
评估方法:如何在任务执行过程中实时评估 Planner 的进化程度?传统的静态基准无法捕捉「越做越聪明」这个动态过程。
写在最后
MIA 回答了一个很基本的问题:Agent 为什么会越做越差?
不是因为模型不够强,而是因为它每次任务之间没有连接——每次都是独立的上下文,每次都是从零开始。
双重记忆闭环的价值,就是让 Agent 真正拥有了「经验」这个资产。不是把对话历史存起来叫经验,而是把「什么策略有效」内化为规划能力。
论文链接:https://arxiv.org/abs/2604.04503
AI-Native Engineering 系列 深度阅读时间:约 10 分钟
💬 评论
💡 使用 GitHub 账号登录 即可参与讨论