DeepAgent:从预定义工具到自主发现
TL;DR
DeepAgent 打破了预定义工具的限制,在推理过程中从 16,000+ RapidAPI 工具库中动态检索和调用工具,配合脑启发式三层记忆架构和端到端强化学习,在 8 个基准测试中持续超越基线方法。
核心观点:从”按剧本演出的演员”到”即兴发挥的全能选手”,DeepAgent 代表了 Agent 从预定义流程向自主推理的范式转变。
1. 背景:预定义工具的天花板
现有 Agent 框架大多遵循「规划-执行-观察」的固定循环。工具在系统设计阶段就被预定义好,Agent 只是在给定的工具集合里做选择。
这个模式的问题在于:
- 工具集是固定的:面对开放世界的真实需求,Agent 无法调用它没见过、没预定义过的工具
- 缺乏全局视角:每步只关注局部目标,不知道整个任务的最优路径
- 工具调用靠匹配:不是真正的理解和推理,而是模式匹配
深度研究 Agent 虽然能在推理中调用工具,但通常只限于搜索、代码执行等少量预定义工具。真实场景中需要的能力远超这个范围。
2. 核心创新
2.1 自主工具发现与调用
DeepAgent 的核心突破:从 16,000+ RapidAPI 工具库中动态检索和调用工具。
不是从预设列表里选,而是:
- 理解任务需求:分析当前任务需要什么能力
- 工具检索:从大规模工具库中检索候选工具
- 评估选择:判断哪个工具最合适
- 执行验证:调用工具并验证结果
这意味着 Agent 具备了真正的工具自主发现能力,而不是在预设菜单里点菜。
2.2 脑启发式三层记忆架构
DeepAgent 采用了一个受大脑启发的三层记忆系统:
┌─────────────────────────────────────────────┐
│ 脑启发式三层记忆架构 │
│ │
│ 情节记忆(Episodic Memory) │
│ ─── 记录关键事件和决策点 │
│ │
│ 工作记忆(Working Memory) │
│ ─── 维护当前目标和推理状态 │
│ │
│ 工具记忆(Tool Memory) │
│ ─── 整合工具使用经验,学习什么场景用什么工具 │
│ │
└─────────────────────────────────────────────┘
三层记忆各有分工,工具记忆尤其关键——它让 Agent 学会「什么任务类型调用什么工具」,而不是每次都重新检索评估。
2.3 自主记忆折叠机制
在长程推理中,Agent 容易陷入「历史堆积导致推理效率下降」的问题。DeepAgent 的解决方案是记忆折叠:
在思考过程中,将先前的推理历史压缩为结构化记忆,保留关键决策点,丢弃冗余中间状态。
作用:
- 效率提升:减少每步需要处理的历史信息量
- 防止错误路径强化:如果之前的推理走了弯路,折叠可以「遗忘」这个错误路径
- 为 Agent 提供「喘息」机会:在密集推理后有一个结构化的整理阶段
2.4 ToolPO:端到端强化学习
传统的工具调用训练面临两个问题:
- 信用分配难:一个任务的成功/失败很难归因到具体某次工具调用
- 样本效率低:真实场景中能获取的训练样本有限
ToolPO 的解决思路:用 LLM 模拟真实 API 调用,生成大量合成训练数据,配合细粒度信用分配实现高效稳定的训练。
这是一个「在仿真环境里学会,再迁移到真实环境」的思路。
3. 为什么重要
DeepAgent 的价值不在于「又一个新的 Agent 框架」,而在于它改变了一个根本假设:
过去:工具是 Agent 的边界
你能调用的工具,决定了你解决问题的能力上限。
现在:工具是 Agent 的扩展
你的推理能力,决定了你能在多大工具库里找到并正确调用合适的工具。
从「按剧本演出的演员」到「即兴发挥的全能选手」,这是范式层面的转变。
4. 反直觉洞察
4.1 工具数量不是越多越好
直觉上,16,000+ 工具意味着更强的能力。但论文的核心发现是:工具检索和选择的能力比工具数量更重要。
一个能从 100 个工具里精准选对的 Agent,优于一个面对 10,000 个工具但选不对的 Agent。
4.2 记忆折叠不是遗忘,是抽象
「记忆折叠」听起来像「忘记」,但实际上是从具体经历中提取高层次结构。这和人类的情景记忆压缩是同类机制。
4.3 强化学习在工具调用上的可行性
ToolPO 证明了用 LLM 模拟 API 环境来训练工具调用策略是可行的。这意味着未来可以让 Agent 在仿真环境中自主学习工具使用,而不是靠人工 prompt 工程。
参考文献
- DeepAgent: A General Reasoning Agent with Scalable Toolsets. arXiv:2510.21618. RUC-NLPIR & Xiaohongshu. https://arxiv.org/abs/2510.21618
💬 评论
💡 使用 GitHub 账号登录 即可参与讨论