三篇论文拆解类人递归自我改进:ASPIRE、S³Gym 与 HarnessDev
teortaxesTex · x · 2026-09-03
Ge Zhang 发布「Toward Human-Like RSI」博客与项目,把递归自我改进(RSI)从「模型反复改写自身权重」的想象拆成可控、可审计的研究问题,共三篇论文:
- ASPIRE:研究 agent 面对模糊目标时如何决定「学什么」;
- S³Gym:研究 agent 如何从带噪声的自生成经验中测试、评判并学习;
- HarnessDev:研究 agent 如何构建并演化外部系统(工具与脚手架)。
作者主张人类式改进的关键在于:目标模糊时自己定义「更好」、自我测试与复盘、同时更新知识与工具。teortaxesTex 评论称,当下真正在发生且奏效的「RSI」更像这种拆解模式——「构建并调试 RL 环境,在其中做更多 RL」,并感慨这种解耦模式竟然此前没出现在 LessWrong 的讨论传统里。
「漫话AGI」频道最新
- AI 高手谈下一波影响:把工作流拆成可验证任务,刻意使用胜过随手用 — hermanschutte · 2026-09-03
- Air Street 的 Benaich:可验证任务是 AI 下一个大规模落地场景 — nathanbenaich · 2026-09-03
- 卫报播客:坐牢20年后,Gemini 的一条邀请改变了他的人生 — nordicinst · 2026-09-03
- AI 自主风险 2023 年预测复盘:agent 化与无人监控全中 — davidmanheim · 2026-09-03
- Patterson 提议对 AI 公司收入征统一销售税 — rand_longevity · 2026-09-03
- 不同派系的 AI 安全观殊途同归:都是集中管控与审查 — mark_k · 2026-09-03