研究者:RL 应自主选题,深度学习难有垂直跃升
一系列帖子探讨深度学习与 RL 的根本局限。作者认为当前 RL 训练环境仍是随机采样,智能体应自主选择下一个问题并做因果性检验;同时指出模型权重无法被检视,导致无法定位认知盲区并进行定向修补,这是深度学习低效、逼近瓶颈的根源。由此作者进一步推论,即便能修补盲区也会带来新漏洞或重塑漏洞拓扑,因此「垂直时间线」式的复利能力跃升不会到来。
2026-09-21 ~ 2026-09-21 · 3 条相关
- 研究者称无法检视权重定位认知盲区,深度学习注定低效 — ryunuck · 2026-09-21
- 续论:认知漏洞无法定向修补,垂直时间线不会到来 — ryunuck · 2026-09-21
- RL 训练该让智能体自己选题:随机采样环境是能力天花板根源 — ryunuck · 2026-09-21