RL 训练该让智能体自己选题:随机采样环境是能力天花板根源

ryunuck · x · 2026-09-21

作者认为当前 RL 训练环境仍是从种群/生成器中随机采样,这正是瓶颈所在:智能体应在 RL 过程中自主选择下一个问题或挑战,并进行因果性检验。他进一步解释为何「垂直时间线」式能力跃迁没有发生——若能定向填补认知盲区,其他知识的应用性会随之重排并指数级复利;而随机采样只会让误差转移到别处。

所属事件:研究者:RL 应自主选题,深度学习难有垂直跃升(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →