价值加载争论:训练数据几乎决定能力,却几乎不决定目标

gleech · x · 2026-09-07

gleech 与 @danwilliamsphil 的对齐讨论线程,指出关键的不确定性论证:训练集上的行为几乎决定了模型"能做什么"(除了捷径与作弊),却几乎不决定它"想要什么"——许多目标在行为上不可区分。更糟的是,最坏情况下的零样本欺骗性对齐连误差信号都没有:部署后的能力泄露(作弊、数据污染)会在真实世界暴露,而对齐代理指标的泄露只能靠"造成伤害"来发现,没有好的误差信号。

所属事件:gleech 论对齐难于能力:能力有反馈,目标错误难暴露(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →