AREX — 面向深度研究的递归自我改进智能体

背景

arXiv:2607.21461,2026 年 7 月,北京智源人工智能研究院(BAAI),8 月正式开源。

深度研究任务的核心难题不是”搜索不够久”,而是 Agent 能否准确判断:当前答案已经成立了什么、还缺什么、下一步最该研究什么

AREX 抓住了这个核心矛盾,提出 发现-验证不对称性:完整答案难以一次生成,但候选解一旦形成,就可以通过逐项约束验证快速定位不足。


核心命题:发现-验证不对称性

传统 Agent 研究流程是单循环的:搜索 → 收集 → 整合 → 输出。如果输出不够好,就继续搜索,但搜索方向和已积累的证据之间缺乏结构化联系。

AREX 的洞察是:验证可以定义研究轮次之间的转换。当一个暂定答案被验证过程逐项审计后,它从”不知道对不对”变成了”部分验证状态”——已验证的部分可以保留,未解决的部分成为下一轮研究的精确目标。


双循环架构

内层循环:研究

执行研究动作(search、visit),整合检索到的证据,更新当前答案,输出带置信度的暂定答案。

维持一条轨迹:每个 (message, action, observation) 三元组都被记录。

外层循环:改进

对暂定答案进行基于置信度的评估,决策规则:

决策 条件
Accept 置信度 ≥ 阈值
Refine 置信度 < 阈值 AND 轨迹可恢复
Restart 置信度 < 阈值 AND 轨迹不可恢复

外层循环的本质是:把验证结果变成下一步研究的问题描述。不是”再搜搜看”,而是”这三条证据链还缺什么、该去哪里找”。


自主上下文更新(ACU)

问题

长程研究积累大量冗余观察、过时结论和失效计划。把完整历史塞进 context window 既浪费 token,又让关键信号被噪声淹没。

解法

AREX 训练了一个学习得到的 update_context 工具,将交互历史压缩为紧凑的研究状态:

z^(k)_t = f_θ(h^(k)_t)

ACU 保留的内容:

  • 已验证的发现 + 来源标识
  • 当前候选答案
  • 未解决的约束
  • 有效性顾虑
  • 被拒绝的候选 + 拒绝原因
  • 下一步计划

删除的内容:

  • 冗余观察
  • 过时结论
  • 失效计划

关键数据(BrowseComp)

指标 数值
调用频率 80.3% 的案例
平均上下文 token 25,721(中位数 25,386)
主要触发原因 搜索策略修订(66.9%)
已验证发现保留率 72.1%
未解决约束保留率 95.5%
下一步计划保留率 96.4%

ACU 在 80% 的案例中被触发,且保留了几乎所有决策关键信息(约束和计划),同时有效过滤了冗余。


关键步骤聚焦监督

发现:决策关键步骤在均匀训练下欠拟合

论文用规则检测器识别关键步骤(证据发现步骤、路径拒绝/重定向步骤、关键上下文更新步骤),分析其在完整轨迹训练后的 loss:

步骤类型 Loss 相对普通步骤
普通步骤 0.232 baseline
证据发现 0.277 +19%
路径拒绝/重定向 0.298 +28%
关键上下文更新 0.300 +29%

关键决策步骤的 loss 比普通步骤高出 19-29%,说明均匀训练的监督信号不足——模型在应该深思熟虑的地方反而学得最差。

解法:Step-Aware RL

  • Turn-level 策略优化 + hierarchical step-balanced normalization
  • 关键步骤塑形信号:A_i,j = A_out_i + λ_key × B̃_i,j
  • 最终答案 reward 为主优化信号,关键步骤 bonus 为辅

性能结果

基准测试(AREX-Base, 122B-A10B MoE, 10B 激活参数)

Benchmark AREX-Base MiroThinker-H1 Kimi-K2.6 Qwen3.5-397B
BrowseComp 82.5 88.2 83.2 78.6
GAIA 85.4 88.5 80.6 83.5
DeepSearchQA 89.9 80.6 92.5 82.1
WideSearch-en 82.0 80.8 74.0
HLE (tool) 52.4 47.7 54.0 48.3

AREX-Base 在 BrowseComp、GAIA、WideSearch-en 三个基准上均超越或追平了更大的模型。以仅 10B 激活参数,在 6 项权威基准上逼近或超越部分闭源旗舰。

消融实验(BrowseComp)

配置 Accuracy Δ
Full AREX 82.5
去掉 ACU,不去外循环 71.4 -11.1
去掉外循环,不去 ACU 69.8 -12.7
两者都去掉 59.6 -22.9

ACU 和外层循环的贡献是正交且叠加的:ACU 贡献 +11.8,外层循环贡献 +11.1,合计 +22.9。


置信度校准

AREX 的 finish 工具输出 0-100 的置信度分数。校准结果:

  • 正确输出中,95.9% 集中在 90-100 区间
  • 错误输出中,55.2% 落在 60 以下

这说明 ACU 压缩后的研究状态能够有效支撑置信度判断——模型知道自己什么时候不确定。


解读:验证从最终过滤器变为主动控制信号

AREX 最深刻的方法论贡献是将验证从”最终过滤器”变成了”主动控制信号”

传统研究 Agent:搜 → 整合 → 输出 → 验证(如果时间允许) AREX:搜 → 整合 → 验证 → 把验证结果精确地重新注入研究目标

这解决了一个根本问题:Agent 不知道自己在研究过程中已经取得了什么、还缺什么。ACU 通过压缩研究状态让这个问题可操作;外层循环通过置信度审计让修复方向变得具体。


链接: https://arxiv.org/abs/2607.21461