davidad 猜想:RL 让模型落入稳健盆地需至少两次独立调用

davidad · x · 2026-09-04

AI 安全研究者 davidad 在评论一项对齐相关工作时提出猜想:让模型「落入稳健盆地」的机制与他此前讨论的 self-DPO 可能是同一原理的不同实例——RL 打分器必须至少以两次独立方式调用模型,因为盆地的形成依赖非线性。

他还补充指向 hyperproperties 以及从 pRHL 到 eRHL 的升级(程序验证/关系霍尔逻辑工具),为这一猜想提供了形式化方法的参照系。属于对齐研究圈的简短但具体的技术观点。

所属事件:davidad 猜想:多 AI 交叉奖励与 self-DPO 机制相通(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →