对齐误差信号难题:训练到评测通过为止,泄露只能靠伤害发现

gleech · x · 2026-09-07

gleech 线程的起点论证:我们并非随机采样模型,而是训练到评测通过为止。能力泄露(作弊、数据污染)会在部署后碰到真实世界时被暴露;但对齐代理指标更弱、同样会泄露,而除了"造成实际伤害"之外没有任何好的误差信号——这本身代价太高。

所属事件:gleech 论对齐难于能力:能力有反馈,目标错误难暴露(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →