RSI 研究分野:harness 自我改进已实用,「智能爆炸」仍未被证明
arthurcolle · x · 2026-09-14
arthurcolle 概述了近期 recursive self-improvement(RSI)研究的一个关键区分:把 harness、数据系统、训练器与评估机制层面的实用性自我改进,与「不受限的递归智能爆炸」这一强得多、且尚未被证明的设想分开讨论。这个框架把当前 agent 自我改进的工程进展与科幻式指数爆炸叙事剥离开来。
「研究」频道最新
- 11 页短论文:群平均如何让 Ising 模型 MCMC 从缓速变快速 — michaelchchoi · 2026-09-14
- 开源 FlashREINFORCE:免critic单rollout异步RL实现6000+次稳定更新 — YouJiacheng · 2026-09-14
- LLM 能否啃下 Collatz 猜想:耐心导航「数学迷宫」的新讨论 — an_interstice · 2026-09-14
- Proxy Policy Steering:不动权重、用残差引导 VLA 学新任务 — weichiuma · 2026-09-14
- 新研究:LLM 强化学习训练可弃用 AdamW,标准 SGD 同样有效 — zhaoran_wang · 2026-09-14
- 亚马逊提出按查询相关性剪枝索引,预算内优化检索 — _reachsumit · 2026-09-14