论文笔记:Self-Improving Coding Agents — 跨会话行为规则积累

这次改对了,下次还犯——这是 LLM Agent 的记忆缺陷,也是架构问题。


核心问题:Agent 没有跨会话积累能力

LLM 驱动的编码 Agent 有一个根本性的记忆缺陷:它没有跨会话积累能力。用户在 code review 里告诉 Agent「这里不要用 == 比较浮点数,应该用 math.isclose」,Agent 当次修正了——但下一个会话,它还是一张白纸,遇到同类问题还会再犯。

这不是模型的问题,这是架构的问题:模型权重是固定的,人在 review 里传递的经验知识没有进入任何可积累的地方。


解法:行为规则库(Behavioral Rules)

人类反馈 → 规则抽取 → 规则库积累 → 下次编码时检索应用

具体机制:

  • 规则持久化:每条被接受的 review 评论里蕴含的规则被抽取出来,写入一个版本控制的指令文件(不是模型权重,是显式的文本规则)
  • 自检清单:代码提交前,Agent 执行一个基于规则库的自检,而不是直接输出
  • 规则完整性验证:自动验证规则库的一致性,防止规则之间冲突或冗余
  • 跨语言标准:规则库里包含语言特定的编码标准(15+ 种语言特定规范)

部署效果

35+ 服务的微服务平台:

  • 规则库从 5 条增长到 18 条行为规则 + 15+ 语言标准 + 15 条自检清单
  • 11 个真实工作会话(代码生成、PR review、故障调查、跨服务重构)里,规则针对的错误类别实现了 0% 复发率
  • review 工作从「低层次正确性检查」转移到「设计层面的验证」

为什么这条路线比微调和 RAG 更聪明

方案 优点 缺点
SFT 微调 知识固化进模型 成本高,不可回滚,无法解释
RAG 知识可更新 检索质量依赖,规则和上下文匹配不稳定
行为规则库 轻量、可审计、可编辑、不改权重 需要规则抽取的自然语言处理能力

经验知识不需要进入模型权重才能被利用。行为规则是显式的、可文本审查的——用户可以直接读规则库,修改某条规则,删除某条规则,而不需要重新训练模型。这在企业场景里非常重要:合规团队需要能审查 AI 的决策依据,行为规则库提供了这个可能性。


关联论文


结论:跨会话经验积累不需要改模型权重——显式规则库是一个低成本、高回报的方向。