路由即裁判:Risa 如何用 MoE 内部信号做零成本仲裁
TL;DR
本文核心观点:
- Risa 把 MoE 路由器当零成本裁判 — 长轨迹 coding agent 重复采样时,原生 router trace 本身携带行为角色信号,无需外部 judge、无需跑测试即可仲裁
- 核心机制是「信息位路由一致度」 — 轨迹间选最终 patch 不是靠多数投票或文本共识,而是看哪个 patch 的路由模式更一致
- 本质是 test-time scaling 的「结构派」打法 — 不是砸更多 token 做 uniform sampling,而是用结构信息指导采样聚焦
- 局限:依赖成熟 MoE 模型的行为信号积累 — 对预训练阶段已在大量采样的模型成立,从头训练是废话
背景:test-time scaling 的两条路
要让 coding agent 解决更复杂的问题,有两条主要路线:
路线一:scale up——更大模型、更多参数、更强泛化能力。这是大家最熟悉的路。
路线二:test-time scaling——在推理阶段投入更多计算资源,比如多次采样、树搜索、蒙特卡洛模拟。核心思路是「用更多推理换取答案质量」。
SWE-bench 为主的公开基准上,test-time scaling 的主流打法是 uniform sampling:同一个问题跑 N 次,取多数投票或选取文本最一致的 patch。
但这条路的局限也很明显:
- N 次采样消耗的是 token budget,每次采样都与问题无关的推理消耗
- 文本共识(取最一致的 patch)容易出现「false consensus」:两个都错的 patch 恰好文本相似
- 外部 judge 需要额外的测试执行环境,不是零成本的
Risa(arXiv:2608.22960)走的是第三条路:结构派 test-time scaling。
Risa 的核心洞察:MoE 路由器携带行为信号
Risa 的起点是一个被忽视的观察:
在 MoE(Mixture of Experts)架构中,路由器的决策轨迹——哪个 token 去了哪个 expert、路由器的偏好分布——不仅仅是一个中间计算值,它携带了行为信息。
具体来说:当 coding agent 在同一个问题上做多次采样时,每一次采样都经过 MoE 路由器。路由器在大量采样中积累的路由偏好,隐含地反映了「哪个 patch 更可能对」的信息。
这不是模型的文本层面的一致性,而是路由决策层面的一致性。
两层机制
Risa 在两层上使用路由信号:
轨迹内:路由引导探索/收敛
在单条轨迹内部,路由器信号可以用于:
- 鼓励探索:当路由分布熵高时,说明模型还没确定,采样可以更激进
- 受控收敛:当路由分布熵低且置信时,采样可以更保守,聚焦在已验证的方向上
这相当于在同一条轨迹里动态调整采样策略,而不是从头到尾用同一个温度参数。
轨迹间:信息位路由一致度选最终 patch
在多条轨迹之间,Risa 用「信息位路由一致度」来选最终 patch。
具体逻辑:
- 对同一个问题,采样 N 条轨迹
- 每条轨迹的 patch 都有一个对应的路由器决策序列(expert 选择分布)
- 计算轨迹两两之间的路由一致度(不是文本相似度,而是路由决策的相似度)
- 选路由一致度最高的 patch 作为最终输出
这比文本共识更鲁棒——两个语义相似但实现细节不同的 patch,文本相似度高但路由可能差异很大,反之亦然。
实验结果与可迁移性
Risa 在 SWE-bench 类任务上验证了有效性:
- gpt-oss 宏均解决率:44.9% → 48.2%(+3.3pp)
- Qwen3.6 验证了跨模型可迁移性——路由器信号仲裁不依赖特定模型家族
3.3pp 在 SWE-bench 的语境里不算小。SWE-bench 是一个相对饱和的基准,能往上走 1pp 都是有效提升。
为什么说这是「零成本裁判」
外部 judge 的成本:
- 需要准备测试环境
- 每次裁决都要跑测试
- 测试本身可能有假阳性/假阴性
路由一致度裁决的成本:
- 路由器 trace 是模型推理时自然产生的,不需要额外计算
- 不需要执行测试
- 路由信号是模型内部行为表征,不依赖外部标注
「零成本」指的是不需要引入额外的推理过程或外部依赖,但路由器 trace 本身的存储和计算是已有的,不是额外开销。
局限与前提
Risa 最大的局限在于前提条件:MoE 路由器积累了足够的行为信号。
这对于预训练阶段就在大量采样的成熟模型成立——比如 gpt-oss 系列。但对于:
- 从头训练的模型(路由器没有足够的采样历史)
- 小规模 MoE 模型(路由器信号太稀疏)
- dense model(没有路由器)
这个方案是废话。Risa 的论文也坦承了这一点。
另一个局限是:路由一致度高的 patch 是否真的更好,需要在更多基准上验证。SWE-bench 的任务类型分布未必能代表所有 coding 场景。
对 test-time scaling 赛道的意义
test-time scaling 目前有两条成熟路线:
- 暴力路线:uniform sampling + 文本共识,依赖更多 token 投入
- 结构路线:用额外信号(代码执行结果、形式化验证、路由器 trace)指导采样聚焦
Risa 是结构路线的最新代表。它的价值不在于超越了暴力路线,而在于开辟了一个新的信号维度——模型内部行为信号,此前被忽视的路由器决策轨迹。
这个方向的下一步值得关注:路由器信号之外,还有没有其他被忽视的内部信号可以用于 test-time 仲裁?
写在最后
「用更多推理换取答案质量」这件事,核心问题不是「多少」,而是「什么」。Risa 回答的是:用路由决策的一致性,而不是文本的相似度。
这个信号维度此前被忽视了,因为它不在模型的输出层面,而在模型的「决策过程」层面。Risa 把它挖出来,用作零成本仲裁。
这可能是未来 test-time scaling 的一个重要分支——不是让模型想得更久,而是让模型想得更结构化。
论文链接:https://arxiv.org/abs/2608.22960
AI-Native Engineering 系列 深度阅读时间:约 10 分钟
💬 评论
💡 使用 GitHub 账号登录 即可参与讨论