Skip to main content

# Dream-RSI 一页纸总结与 Insight(arXiv 2609.14858 · Google + UMD · 2026-09)---## 一句话把走过的探索历史变成可查账的“录像带世界”,让“怎么探索”这件事本身在梦里自我改进——agent 冻结,只进化指挥官

  1. # Dream-RSI 一页纸总结与 Insight

    (arXiv 2609.14858 · Google + UMD · 2026-09)

    ---

    ## 一句话

    把走过的探索历史变成可查账的“录像带世界”,让“怎么探索”这件事本身在梦里自我改进——agent 冻结,只进化指挥官。

    ---

    ## 1. 问题:元层改进是个死结

    RSI 发现循环中,探索策略(开哪些分支、并行几个、何时停)决定算力效率,但它难改进:评估一个策略要等它跑完长程 rollout 才有信号 [Meta Bottleneck](https://www.alphaxiv.org/abs/2609.14858?page=2)。三条旧路全堵死:**固定策略**不学习;**在线优化**(如 [EvoX](https://www.alphaxiv.org/abs/2602.23413))每个坏策略都要烧一整段实跑;**历史当上下文**把可执行的结构压扁成散文。

    ## 2. 机制:三层结构 + 一次倒带

    
    元层:策略代码(唯一进化物,每轮 M 版改写)
    对象层:coding agent + evaluator(全程冻结)
    循环:在线探索 → 树入池 → dreaming(argmax) → 重部署
    


    - **重放**:候选策略在已录树上盲走(只见已揭示前缀),查表计分 $V=\max_v s_v-\beta_1 N+\beta_2 N/k$(质量−成本+并行)[Replay Objective](https://www.alphaxiv.org/abs/2609.14858?page=6)
    - **三大性质**:① 零执行成本(单次在线运行支撑数千次评估)[Zero Execution Cost](https://www.alphaxiv.org/abs/2609.14858?page=4);② 公平盲考(信息结构与在线一致);③ 只能重排已付费的尝试——树外的世界查无此账。

    ## 3. 结果(8 任务 / 3 域)

    | 域 | 数字 |
    | --- | --- |
    | Lasso | 317 vs 550 次调用且更快;vs SimpleTES(51,200 代)省约两个数量级 [Lasso Results](https://www.alphaxiv.org/abs/2609.14858?page=7) |
    | 数学优化 | Sum-Diff 最优、Circle Packing 并列最强;约 50× 预算节省 [Math Results](https://www.alphaxiv.org/abs/2609.14858?page=9) |
    | [KernelBench](https://www.alphaxiv.org/abs/2502.10517) | 同性能省 2.43×/1.79×;同预算 +2.09×/1.44× [Kernel Results](https://www.alphaxiv.org/abs/2609.14858?page=10) |

    **最有信息量的两个副产品**:历史当提示词**反而更差**(语义指导过度约束、杀死多样性)[Guidance Hurts](https://www.alphaxiv.org/abs/2609.14858?page=11);策略自发涌现算力调度(顺利时收缩、平台期加注)[Adaptive Compute](https://www.alphaxiv.org/abs/2609.14858?page=11)

    ## 4. 批判边界

    - **Proxy gap 是总软肋**:单调保证只在重放分上;“考场成绩 → 远方表现”无理论桥,纯靠实验兜底
    - **成本账不全**:M、K₂、dreaming 耗时未报;跨 backbone 对比口径混杂(SimpleTES 用 gpt-oss-120b)
    - **不扩展**:考卷只增不减 → 重放量 O(M·t)、存储线性膨胀,池子修剪只字未提
    - 元目标(β₁、β₂)手工冻结——“元层之上还有元层”被回避

    ## 5. Insight(本对话沉淀的五条)

    1. **改进的是指挥官,不是肌肉**——模型/harness/技能那条自我进化主线之外,存在一个更便宜的杠杆:算力分配的智能化
    2. **历史是考场,不是答案册**——当提示词(信念)有害,当模拟器(事实)有益;区别在“能否被打分”
    3. **免费反事实有严格边界**:只覆盖已实现尝试的**重排**(顺序/批量/剪枝/停点);新大陆的反事实必须真金白银去踩——所以循环必须在线-离线交替,无法纯离线自嗨
    4. **循环的双重身份**:既是改进机制,也是对账机制——proxy 每说谎一次,实绩就把谎言记账进下一张考卷;但这是工程保险丝(停滞触发 + 可回滚),不是收敛定理
    5. **"World"是弱义世界模型**——拒绝预言、只肯对账的录像带;机制扎实,词汇借光

    ## 6. 一言以蔽之

    $$\pi_{t+1}=\arg\max_m \frac{1}{t}\sum_i\Big[\max_{v\in\mathcal{T}_i^m}s_v-\beta_1 N+\beta_2\tfrac{N}{k}\Big]$$

    
    flowchart LR
      A[在线探索 π_t] --> B[(树入池)]
      B --> C[Dreaming: 重放 M 个候选]
      C --> D[argmax V]
      D -->|部署| A
    


    餐巾纸上的那句话:先在梦里重走一千条旧路,再挑最好的一条去踩新的地。 Dream-RSI: Recursive Self-Improvement through Evolving Worlds