论文笔记:Autonomous Research Agents — 验证鸿沟才是真正的瓶颈

当 AI 开始自己读文献、设计实验、写论文——它产出的结论,有人能验证吗?


背景:26 个系统,35 篇论文,验证鸿沟有多大

研究者从 125 篇候选文献中筛出 35 篇,对 26 个系统进行全文编码分析,覆盖七个审计维度:生命周期阶段、自主级别、评估方法、发布工件、人工介入点、新颖性验证、结果选择披露。

核心数据

  • 83% 的系统发布了代码
  • 仅 38% 发布了种子或执行轨迹(能让别人重跑实验)
  • 仅 38% 报告了任何新颖性验证方法
  • 88% 披露了至少一个人工介入点

核心发现:开源不等于可复现,能写完不等于能查证

论文构建了一个八级”验证信号谱系”——从最硬的形式验证器(定理证明)到最软的模型自评(LLM 当裁判)。

一个尴尬的事实是:验证信号最硬的领域,恰恰是 AI 科学家最少的领域。

在 9 个自称”闭环”(L4 级自主)的系统中,7 个被判定为”机械空转”——结果确实喂回去了,但触发下一轮的是内部指标或常数拟合,而不是对科学假设的真正修订。没有任何 LLM 时代的系统展示了经外部验证的在环预言机。


核心判断

该领域的瓶颈已经从”Agent 能否完成研究任务”转向”审稿人能否验证 Agent 产出的声明”。

能自动执行不等于能自动判断——机器可以把”测一下、算一下、喂回去”跑得飞快,但”这个结果到底有没有推进科学”,它一次都没判断过。


关联论文


结论:自主研究 Agent 的瓶颈不是”能不能做研究”,而是”能不能被验证”——这是从能力问题转向信任问题的根本转换。