Weekly Trend Offline Precomputation Structural Representation
本周趋势:运行时不确定性,正在被压到离线
(2026-08-25 至 2026-09-05,9 篇精选)
本周最清晰的信号,不是某篇论文提出了什么新模型,而是三条技术路线在收敛同一个结论:
把”运行时不确定性”压到离线预计算 + 结构化中间表示上,用前置工程换线上稳定与低成本。
从 RAG 的图投影,到 Coding Agent 的轨迹压缩,再到多 Agent 系统的记忆管理,所有人都在做同一件事:别让 Agent 在线的时候临时猜,边跑边算代价太高。
线一:RAG——图的拓扑预计算,替代在线遍历
ISO-RAG(UNSW)把知识图投影到双曲 Poincaré 球,在检索前就预计算好节点等周剖面,在线时只做局部子图扩散,不需要全局遍历。多跳 QA 召回+10%,EM+4.3%。
ProRetrieval 走了另一条路:让 LLM 生成混合 DSL 程序(SQL 算子 + 向量检索原语 + 布尔逻辑),而不是在线改写 query。Qwen3-4B 经强化学习训练后,电商 Hit@1 0.81,超越 GPT-5.5 的 0.69。
The Laws of Context Allocation 则是从因果层面证明:”单体扩上下文”是相关度衰减陷阱,顺序多轮生成迭代分配 compute 带来 16.7–20.5pp 召回提升。核心洞察:上下文预算不是塞满,而是按需顺序分配。
三篇共同指向:图结构提前建,检索逻辑提前编译,上线只做局部查询。
线二:Coding Agent——轨迹压缩成 rollout summary,替代在线探索
Scaling Test-Time Compute(Meta/CMU/Princeton)用 rollout 轨迹压缩成结构化 summary(假设/进展/失败模式),再做递归投票与顺序精炼。Claude-4.5-Opus 在 SWE-Bench Verified 从 70.9% 升到 77.6%,Terminal-Bench v2 从 46.9% 升到 59.1%。
关键洞察:长程 coding agent 的瓶颈不是采样数不够,而是表示-选择-复用做得不好——意思是 agent 需要更好的结构来压缩自己的历史经验,而不是堆更多的在线 rollout。
SWE-bench Science 和 SWE-Bench ProMax 则在给这个领域降温:当前最强模型(Claude Code + Opus-5)在科学软件任务 pass@1 < 50%,多语言重构任务最佳 resolve 率仅 41.2%。这不是一个已经解决的问题。
共同指向:别光卷模型,先把轨迹的结构化表示做好。
线三:多 Agent 系统——记忆升维成技能库,替代日志堆积
MAGE 把 agent/消息/工具/错误/证据存为异质时序超图,保留高阶协作事件而非扁平向量。支持决策驱动更新、角色感知检索、生命周期管理,不需要改模型权重就可以扩展知识边界。
MASkills 把经验记忆升维成”技能”——时机/方式/工具的结构化程序知识,经过精炼/归纳/整合/剪枝演化。HotpotQA/LoCoMo/GAIA 全面占优。
ReCache 则是在工程层面解决工具密集型 agent 的 KV 缓存问题:跨工具切换时 prefix cache 失效,因为工具 schema 混排破坏组合不变性。解决方案是 resource-wise attention + 结构/语义剪枝,TTFT 加速 3.655×,KV 显存省 92.43%。
共同指向:别让每个 agent 每次任务都从零开始,把可复用的结构预计算好。
三条线,一个方向
| 层级 | 离线预计算 | 结构化中间表示 |
|---|---|---|
| RAG | 图拓扑、等周剖面 | DSL 程序、因果上下文分配 |
| Coding Agent | Rollout 轨迹压缩 | 超图 summary、递归投票 |
| 多 Agent 记忆 | 技能库演化 | 异质时序超图 |
核心工程哲学是前置化:
- 不要在线猜,要在离线把结构建好
- 不要扁平存储,要在结构化表示里保留高阶关系
- 不要每次重算,要在预算约束下做最优调度
这和 Mitchell Hashimoto 的 Harness Engineering 是同一个逻辑的不同切面——减少 runtime 的不确定性,等于减少在线代价。只不过这里的 harness 不是约束规则,而是预计算好的结构和表示。
值得跟踪的问题
- 表示层碎片化:DSL、超图、rollout summary、时序超图……每条线都在定义自己的结构化语言,跨线复用有没有可能?
- 评测的滞后:SWE-bench Science 已经说明公开测试和真实科学任务之间存在巨大差距,benchmark 追上实际场景的速度远慢于模型刷榜的速度
- 前置工程 vs 动态适应:预计算换稳定,但当任务真的偏离预计算假设时,Agent 的在线适应能力够不够用?
共 9 篇,全部 2026-08 下旬至 09 月上旬,附源码/数据,与历史清单零重复。
💬 评论
💡 使用 GitHub 账号登录 即可参与讨论