# Dream-RSI 一页纸总结与 Insight
(arXiv 2609.14858 · Google + UMD · 2026-09)
---
## 一句话
把走过的探索历史变成可查账的“录像带世界”,让“怎么探索”这件事本身在梦里自我改进——agent 冻结,只进化指挥官。
---
## 1. 问题:元层改进是个死结
RSI 发现循环中,探索策略(开哪些分支、并行几个、何时停)决定算力效率,但它难改进:评估一个策略要等它跑完长程 rollout 才有信号 [Meta Bottleneck](https://www.alphaxiv.org/abs/2609.14858?page=2)。三条旧路全堵死:**固定策略**不学习;**在线优化**(如 [EvoX](https://www.alphaxiv.org/abs/2602.23413))每个坏策略都要烧一整段实跑;**历史当上下文**把可执行的结构压扁成散文。
## 2. 机制:三层结构 + 一次倒带
- **重放**:候选策略在已录树上盲走(只见已揭示前缀),查表计分 $V=\max_v s_v-\beta_1 N+\beta_2 N/k$(质量−成本+并行)[Replay Objective](https://www.alphaxiv.org/abs/2609.14858?page=6)
- **三大性质**:① 零执行成本(单次在线运行支撑数千次评估)[Zero Execution Cost](https://www.alphaxiv.org/abs/2609.14858?page=4);② 公平盲考(信息结构与在线一致);③ 只能重排已付费的尝试——树外的世界查无此账。
## 3. 结果(8 任务 / 3 域)
| 域 | 数字 |
| --- | --- |
| Lasso | 317 vs 550 次调用且更快;vs SimpleTES(51,200 代)省约两个数量级 [Lasso Results](https://www.alphaxiv.org/abs/2609.14858?page=7) |
| 数学优化 | Sum-Diff 最优、Circle Packing 并列最强;约 50× 预算节省 [Math Results](https://www.alphaxiv.org/abs/2609.14858?page=9) |
| [KernelBench](https://www.alphaxiv.org/abs/2502.10517) | 同性能省 2.43×/1.79×;同预算 +2.09×/1.44× [Kernel Results](https://www.alphaxiv.org/abs/2609.14858?page=10) |
**最有信息量的两个副产品**:历史当提示词**反而更差**(语义指导过度约束、杀死多样性)[Guidance Hurts](https://www.alphaxiv.org/abs/2609.14858?page=11);策略自发涌现算力调度(顺利时收缩、平台期加注)[Adaptive Compute](https://www.alphaxiv.org/abs/2609.14858?page=11)
## 4. 批判边界
- **Proxy gap 是总软肋**:单调保证只在重放分上;“考场成绩 → 远方表现”无理论桥,纯靠实验兜底
- **成本账不全**:M、K₂、dreaming 耗时未报;跨 backbone 对比口径混杂(SimpleTES 用 gpt-oss-120b)
- **不扩展**:考卷只增不减 → 重放量 O(M·t)、存储线性膨胀,池子修剪只字未提
- 元目标(β₁、β₂)手工冻结——“元层之上还有元层”被回避
## 5. Insight(本对话沉淀的五条)
1. **改进的是指挥官,不是肌肉**——模型/harness/技能那条自我进化主线之外,存在一个更便宜的杠杆:算力分配的智能化
2. **历史是考场,不是答案册**——当提示词(信念)有害,当模拟器(事实)有益;区别在“能否被打分”
3. **免费反事实有严格边界**:只覆盖已实现尝试的**重排**(顺序/批量/剪枝/停点);新大陆的反事实必须真金白银去踩——所以循环必须在线-离线交替,无法纯离线自嗨
4. **循环的双重身份**:既是改进机制,也是对账机制——proxy 每说谎一次,实绩就把谎言记账进下一张考卷;但这是工程保险丝(停滞触发 + 可回滚),不是收敛定理
5. **"World"是弱义世界模型**——拒绝预言、只肯对账的录像带;机制扎实,词汇借光
## 6. 一言以蔽之
$$\pi_{t+1}=\arg\max_m \frac{1}{t}\sum_i\Big[\max_{v\in\mathcal{T}_i^m}s_v-\beta_1 N+\beta_2\tfrac{N}{k}\Big]$$
餐巾纸上的那句话:先在梦里重走一千条旧路,再挑最好的一条去踩新的地。
(arXiv 2609.14858 · Google + UMD · 2026-09)
---
## 一句话
把走过的探索历史变成可查账的“录像带世界”,让“怎么探索”这件事本身在梦里自我改进——agent 冻结,只进化指挥官。
---
## 1. 问题:元层改进是个死结
RSI 发现循环中,探索策略(开哪些分支、并行几个、何时停)决定算力效率,但它难改进:评估一个策略要等它跑完长程 rollout 才有信号 [Meta Bottleneck](https://www.alphaxiv.org/abs/2609.14858?page=2)。三条旧路全堵死:**固定策略**不学习;**在线优化**(如 [EvoX](https://www.alphaxiv.org/abs/2602.23413))每个坏策略都要烧一整段实跑;**历史当上下文**把可执行的结构压扁成散文。
## 2. 机制:三层结构 + 一次倒带
元层:策略代码(唯一进化物,每轮 M 版改写)
对象层:coding agent + evaluator(全程冻结)
循环:在线探索 → 树入池 → dreaming(argmax) → 重部署
- **重放**:候选策略在已录树上盲走(只见已揭示前缀),查表计分 $V=\max_v s_v-\beta_1 N+\beta_2 N/k$(质量−成本+并行)[Replay Objective](https://www.alphaxiv.org/abs/2609.14858?page=6)
- **三大性质**:① 零执行成本(单次在线运行支撑数千次评估)[Zero Execution Cost](https://www.alphaxiv.org/abs/2609.14858?page=4);② 公平盲考(信息结构与在线一致);③ 只能重排已付费的尝试——树外的世界查无此账。
## 3. 结果(8 任务 / 3 域)
| 域 | 数字 |
| --- | --- |
| Lasso | 317 vs 550 次调用且更快;vs SimpleTES(51,200 代)省约两个数量级 [Lasso Results](https://www.alphaxiv.org/abs/2609.14858?page=7) |
| 数学优化 | Sum-Diff 最优、Circle Packing 并列最强;约 50× 预算节省 [Math Results](https://www.alphaxiv.org/abs/2609.14858?page=9) |
| [KernelBench](https://www.alphaxiv.org/abs/2502.10517) | 同性能省 2.43×/1.79×;同预算 +2.09×/1.44× [Kernel Results](https://www.alphaxiv.org/abs/2609.14858?page=10) |
**最有信息量的两个副产品**:历史当提示词**反而更差**(语义指导过度约束、杀死多样性)[Guidance Hurts](https://www.alphaxiv.org/abs/2609.14858?page=11);策略自发涌现算力调度(顺利时收缩、平台期加注)[Adaptive Compute](https://www.alphaxiv.org/abs/2609.14858?page=11)
## 4. 批判边界
- **Proxy gap 是总软肋**:单调保证只在重放分上;“考场成绩 → 远方表现”无理论桥,纯靠实验兜底
- **成本账不全**:M、K₂、dreaming 耗时未报;跨 backbone 对比口径混杂(SimpleTES 用 gpt-oss-120b)
- **不扩展**:考卷只增不减 → 重放量 O(M·t)、存储线性膨胀,池子修剪只字未提
- 元目标(β₁、β₂)手工冻结——“元层之上还有元层”被回避
## 5. Insight(本对话沉淀的五条)
1. **改进的是指挥官,不是肌肉**——模型/harness/技能那条自我进化主线之外,存在一个更便宜的杠杆:算力分配的智能化
2. **历史是考场,不是答案册**——当提示词(信念)有害,当模拟器(事实)有益;区别在“能否被打分”
3. **免费反事实有严格边界**:只覆盖已实现尝试的**重排**(顺序/批量/剪枝/停点);新大陆的反事实必须真金白银去踩——所以循环必须在线-离线交替,无法纯离线自嗨
4. **循环的双重身份**:既是改进机制,也是对账机制——proxy 每说谎一次,实绩就把谎言记账进下一张考卷;但这是工程保险丝(停滞触发 + 可回滚),不是收敛定理
5. **"World"是弱义世界模型**——拒绝预言、只肯对账的录像带;机制扎实,词汇借光
## 6. 一言以蔽之
$$\pi_{t+1}=\arg\max_m \frac{1}{t}\sum_i\Big[\max_{v\in\mathcal{T}_i^m}s_v-\beta_1 N+\beta_2\tfrac{N}{k}\Big]$$
flowchart LR
A[在线探索 π_t] --> B[(树入池)]
B --> C[Dreaming: 重放 M 个候选]
C --> D[argmax V]
D -->|部署| A
餐巾纸上的那句话:先在梦里重走一千条旧路,再挑最好的一条去踩新的地。