Arex Recursively Self Improving Agent
AREX — 面向深度研究的递归自我改进智能体
背景
arXiv:2607.21461,2026 年 7 月,北京智源人工智能研究院(BAAI),8 月正式开源。
深度研究任务的核心难题不是”搜索不够久”,而是 Agent 能否准确判断:当前答案已经成立了什么、还缺什么、下一步最该研究什么。
AREX 抓住了这个核心矛盾,提出 发现-验证不对称性:完整答案难以一次生成,但候选解一旦形成,就可以通过逐项约束验证快速定位不足。
核心命题:发现-验证不对称性
传统 Agent 研究流程是单循环的:搜索 → 收集 → 整合 → 输出。如果输出不够好,就继续搜索,但搜索方向和已积累的证据之间缺乏结构化联系。
AREX 的洞察是:验证可以定义研究轮次之间的转换。当一个暂定答案被验证过程逐项审计后,它从”不知道对不对”变成了”部分验证状态”——已验证的部分可以保留,未解决的部分成为下一轮研究的精确目标。
双循环架构
内层循环:研究
执行研究动作(search、visit),整合检索到的证据,更新当前答案,输出带置信度的暂定答案。
维持一条轨迹:每个 (message, action, observation) 三元组都被记录。
外层循环:改进
对暂定答案进行基于置信度的评估,决策规则:
| 决策 | 条件 |
|---|---|
| Accept | 置信度 ≥ 阈值 |
| Refine | 置信度 < 阈值 AND 轨迹可恢复 |
| Restart | 置信度 < 阈值 AND 轨迹不可恢复 |
外层循环的本质是:把验证结果变成下一步研究的问题描述。不是”再搜搜看”,而是”这三条证据链还缺什么、该去哪里找”。
自主上下文更新(ACU)
问题
长程研究积累大量冗余观察、过时结论和失效计划。把完整历史塞进 context window 既浪费 token,又让关键信号被噪声淹没。
解法
AREX 训练了一个学习得到的 update_context 工具,将交互历史压缩为紧凑的研究状态:
z^(k)_t = f_θ(h^(k)_t)
ACU 保留的内容:
- 已验证的发现 + 来源标识
- 当前候选答案
- 未解决的约束
- 有效性顾虑
- 被拒绝的候选 + 拒绝原因
- 下一步计划
删除的内容:
- 冗余观察
- 过时结论
- 失效计划
关键数据(BrowseComp)
| 指标 | 数值 |
|---|---|
| 调用频率 | 80.3% 的案例 |
| 平均上下文 token | 25,721(中位数 25,386) |
| 主要触发原因 | 搜索策略修订(66.9%) |
| 已验证发现保留率 | 72.1% |
| 未解决约束保留率 | 95.5% |
| 下一步计划保留率 | 96.4% |
ACU 在 80% 的案例中被触发,且保留了几乎所有决策关键信息(约束和计划),同时有效过滤了冗余。
关键步骤聚焦监督
发现:决策关键步骤在均匀训练下欠拟合
论文用规则检测器识别关键步骤(证据发现步骤、路径拒绝/重定向步骤、关键上下文更新步骤),分析其在完整轨迹训练后的 loss:
| 步骤类型 | Loss | 相对普通步骤 |
|---|---|---|
| 普通步骤 | 0.232 | baseline |
| 证据发现 | 0.277 | +19% |
| 路径拒绝/重定向 | 0.298 | +28% |
| 关键上下文更新 | 0.300 | +29% |
关键决策步骤的 loss 比普通步骤高出 19-29%,说明均匀训练的监督信号不足——模型在应该深思熟虑的地方反而学得最差。
解法:Step-Aware RL
- Turn-level 策略优化 + hierarchical step-balanced normalization
- 关键步骤塑形信号:
A_i,j = A_out_i + λ_key × B̃_i,j - 最终答案 reward 为主优化信号,关键步骤 bonus 为辅
性能结果
基准测试(AREX-Base, 122B-A10B MoE, 10B 激活参数)
| Benchmark | AREX-Base | MiroThinker-H1 | Kimi-K2.6 | Qwen3.5-397B |
|---|---|---|---|---|
| BrowseComp | 82.5 | 88.2 | 83.2 | 78.6 |
| GAIA | 85.4 | 88.5 | 80.6 | 83.5 |
| DeepSearchQA | 89.9 | 80.6 | 92.5 | 82.1 |
| WideSearch-en | 82.0 | — | 80.8 | 74.0 |
| HLE (tool) | 52.4 | 47.7 | 54.0 | 48.3 |
AREX-Base 在 BrowseComp、GAIA、WideSearch-en 三个基准上均超越或追平了更大的模型。以仅 10B 激活参数,在 6 项权威基准上逼近或超越部分闭源旗舰。
消融实验(BrowseComp)
| 配置 | Accuracy | Δ |
|---|---|---|
| Full AREX | 82.5 | — |
| 去掉 ACU,不去外循环 | 71.4 | -11.1 |
| 去掉外循环,不去 ACU | 69.8 | -12.7 |
| 两者都去掉 | 59.6 | -22.9 |
ACU 和外层循环的贡献是正交且叠加的:ACU 贡献 +11.8,外层循环贡献 +11.1,合计 +22.9。
置信度校准
AREX 的 finish 工具输出 0-100 的置信度分数。校准结果:
- 正确输出中,95.9% 集中在 90-100 区间
- 错误输出中,55.2% 落在 60 以下
这说明 ACU 压缩后的研究状态能够有效支撑置信度判断——模型知道自己什么时候不确定。
解读:验证从最终过滤器变为主动控制信号
AREX 最深刻的方法论贡献是将验证从”最终过滤器”变成了”主动控制信号”。
传统研究 Agent:搜 → 整合 → 输出 → 验证(如果时间允许) AREX:搜 → 整合 → 验证 → 把验证结果精确地重新注入研究目标
这解决了一个根本问题:Agent 不知道自己在研究过程中已经取得了什么、还缺什么。ACU 通过压缩研究状态让这个问题可操作;外层循环通过置信度审计让修复方向变得具体。
链接: https://arxiv.org/abs/2607.21461
💬 评论
💡 使用 GitHub 账号登录 即可参与讨论