反驳:让 RL agent 在真实世界训练「对能力是好主意,对安全是坏主意」

lukalotl · x · 2026-10-05

lukalotl 反驳「在真实世界训练 LLM」的观点:这对能力来说可能是好主意,对安全来说是坏主意。原因在于:LLM 的自我修改速度远快于人类,而我们通常希望能在安全环境中先评估它们再放进真实世界。

他指出,即使是人们最悲观的风险场景,一般也默认不会让 RL agent 在与世界持续接触的状态下自由演化——那样做的危险性极高。

所属事件:安全研究者激辩:前沿模型该在真实世界还是模拟世界中训练(7 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →