“自我进化”是2026年Agent最热的词汇之一。每篇论文都在宣称自己的方法让LLM Agent能够”从经验中学习”、”持续自我改进”。但如果你把这些Agent放到真实的流式任务场景里,它们真的还在进化吗?

Microsoft和CASIA的研究者最近发表了一篇很扎实的论文——AgentStream(arXiv: 2608.00155)。他们做的事情很简单:不再在隔离的单任务上做评估,而是把Agent扔进真实的流式任务环境里。结果,那些在论文里光鲜的”自我进化”方法,原形毕露。

问题出在哪里:隔离评估的幻觉

过去所有关于Agent自我进化的研究,评估方式几乎都是一个套路:给Agent一个任务,让它完成,然后评估。下一个任务再来一遍,完全独立。

但现实世界不是这样的。真实场景中,Agent面对的是流式任务——任务一个接一个来,可能跨领域,可能交替出现,Agent需要基于历史经验做判断。这两种评估方式的差距,可能比很多人意识到的要大得多。

论文的核心批评就在这里:隔离评估高估了自我进化的实际效果。在隔离环境下,任务分布一致、方法论容易优化,但一旦进入真实的任务流,许多”进化”出来的能力根本不稳定。

AgentStream的方法:三种流式场景

研究团队构建了一套统一的评估框架AgentStream,把现有的Agent基准测试组织成可配置的任务流,在测试时实例化了三种递进的流式场景:

  • Isolated(隔离场景):每个任务独立完成,任务之间没有交叉,评估的是最理想的进化条件
  • Sequential(顺序场景):任务按领域分组依次出现,比如先连续做5个编程任务,再做5个推理任务——这里出现了跨领域干扰
  • Interleaved(交错场景):任务在多个领域之间交替出现,比如编程、推理、规划任务穿插着来——更接近真实部署的复杂度

他们选了5种有代表性的自进化方法,在3个前沿基础模型上,在6个基准测试上做了组合评估。这套方法论本身就很值得借鉴:把方法、模型、场景三个维度解耦,才能看清楚每个变量到底在起什么作用。

三个反直觉的关键发现

1. 弱模型越进化越差

这是论文最刺激的结论之一。在流式场景下,能力较弱的模型不仅没有从自我进化中受益,反而性能下降了

原因很直觉:弱模型本身从失败经验中提取有效知识的能力就不足。当它”反思”自己的错误时,往往学到的是错误或噪声知识,然后在下一次任务中把这些错误知识又用了进去。结果是越反思越乱。

这个发现对 practitioners 的警示很明显:如果你的底座模型本身能力不够,别指望通过”自我进化”来弥补——你很可能在帮倒忙。

2. 进化收益是模型能力的非线性函数

这个结论更微妙。不是说模型越强进化收益越高——中等能力的模型从自我进化中获益最大,最强模型的额外收益反而相对有限。

原因是:最强模型的基线性能已经很高了,进化的边际收益递减;而弱模型则是根本学不到有价值的东西。中间那一档的模型,刚好有足够的”学习带宽”来消化经验教训,同时基线又不是那么高不可攀。

这意味着,如果你要在某个模型上启用自我进化,先评估它处于哪个能力区间,而不是无脑开启。

3. 没有通用最优进化方法

这是论文最实用的结论。在隔离场景下,上下文集成类方法表现最好,因为任务分布一致,积累的经验高度相关。但在交错场景下,基于检索的方法开始显示出优势——因为检索机制能够更有效地抑制跨域干扰,从历史经验中精准提取相关知识。

换句话说:根本没有一种方法在所有场景、所有模型上都管用。你用GPT-4o最优的配置,换到Claude可能就不work;你在单任务隔离评估里验证有效的方法,放到交错场景可能反而拖累性能。

更有意思的一个反直觉发现:交错场景(Interleaved)通常优于顺序场景(Sequential)。原因是交错的多样性反而帮助Agent建立了更具迁移性的知识结构,而顺序场景的连续同类任务会放大跨域噪声的干扰。

对实践者的含义

说了这么多,对于真正在做Agent系统的工程师,这篇论文意味着什么?

第一,先测真实场景再上生产。 如果你开发了一套自我进化机制,强烈建议在隔离评估之外加一套流式场景测试。尤其是任务来源多元、生产环境复杂的系统,隔离评估给你的信心是虚高的。

第二,底座模型能力是天花板。 在选择是否启用、如何配置自我进化之前,先搞清楚你的底座模型处于什么能力水平。弱模型上,与其花时间调自我进化策略,不如先换一个更强的底座。

第三,不要迷信”最佳实践”。 论文里的对比实验告诉我们,很多流行的自我进化方法在某些场景下有效,在另一些场景下可能是有害的。配置选择需要基于你的实际任务流特征来做判断,而不是照搬别人的方案。

第四,考虑检索增强的进化架构。 在任务来源多样、跨域明显的场景下,基于检索的进化机制比纯参数化的自我反思更稳定。检索机制提供了更好的知识隔离,不容易让无关领域的经验污染当前任务。

总结

AgentStream的核心贡献不是提出了某个新方法,而是揭示了一个被长期忽视的评估缺陷——在隔离环境下,自我进化是一个被美化的故事;但一旦进入真实的流式任务流,许多方法要么失效,要么适得其反。

最值得记住的三句话:

  • 弱模型自我进化,越进化越差
  • 进化收益非单调,中间档模型最受益
  • 没有通用最优方法,场景和模型共同决定选择

自我进化不是银弹,但它也不是伪命题。关键在于匹配——底座能力与进化方法的匹配,评估场景与部署场景的匹配。AgentStream给我们提了个醒:在把”自我进化”部署到生产环境之前,先用流式场景做一次reality check。

论文:AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?(arXiv: 2608.00155)
作者:Dong Yan, Jian Liang, Dapeng Hu, Ran He, Nicholas Jing Yuan, Qi Zhang, Tieniu Tan(Microsoft + CASIA)
代码:https://github.com/Jasper-Yan/AgentStream