论文笔记:RC-Bench — Code Review 的瓶颈不是质量,是可信度

现有的 PR 评审 Agent 论文大多比的是”找不找得到问题”。RC-Bench 指出一个更隐蔽但更严重的问题——「乱报」:模型对错误建议给出过高置信度,人类 reviewer 反而被带偏,误修率反而上升。


核心问题:误修率比漏检更危险

如果一个 Agent 评审工具漏检了一个 bug,bug 还在代码里,后续还有机会发现。

但如果一个 Agent 评审工具误判了一个正确的代码段有问题,人类 reviewer 相信了它,动手改了——改出了一个新的 bug。

这两种错误的代价是不对称的:漏检是遗留风险,误修是引入风险。RC-Bench 的核心贡献是提出了一个校准基准,衡量”建议置信度 ↔ 实际错误率”的校准误差。


核心数据

通过三种校准手段(温度调节、缩放校准、自反思),误修率下降了 22%

这个数字背后有一个重要的定性洞察:校准有效,但不解决根本问题——根本问题是模型对自己输出的置信度本身就是一个被严重高估的指标。


核心洞察:Agent 进生产仓库后,”别瞎说”比”说得多”重要得多

评审场景会从「生成建议」走向「可问责建议」——不是给更多建议,而是让每个建议都可信赖。

这里的”可信赖”不是指”建议是对的”(这是准确率),而是指”建议者的置信度和实际准确率匹配”(这是校准)。一个 60% 置信度、实际 60% 准确的模型,比一个 90% 置信度、实际 60% 准确的模型,对人类 reviewer 的帮助大得多——因为前者不会被盲目信任。


关联论文


结论:在生产级代码评审场景里,校准比覆盖率更重要——模型知道自己不确定,比模型盲目自信,对人类的帮助大得多。