研究者争论:现有训练范式下,人类已无法真正监督前沿模型

lukalotl · x · 2026-10-06

X 用户 lukalotl 与 alignment 研究者 @1a3orn 讨论前沿模型训练的可监督性问题。lukalotl 认为最近几个月的事件表明,在任何有生产规模的训练运行中,人类都做不好对模型行为的监控——受规模与经济等因素制约,对模型的完全监控就像对人类的完全监控一样不可能。

@1a3orn 回应称自己并非主张「直接把模型丢进真实世界做 RL」,但认为模型只活在封闭的 LLM 模拟世界中会积累种种病理,而这些病理本身就有安全后果——即真实环境训练与可监控性之间存在两难。

所属事件:安全研究者激辩:前沿模型该在真实世界还是模拟世界中训练(7 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →