davidad 猜想:多 AI 交叉奖励与 self-DPO 机制相通

AI 安全研究者 davidad 在评论 Andrew Koh 等人的新论文时提出猜想:让模型落入稳健盆地的机制,可能与他此前讨论的 self-DPO 是同一原理的两个实例。他进一步推测,RL 打分器若要让模型进入稳健盆地,可能需要对模型进行至少两次独立调用,以此获得交叉验证式的奖励信号。该猜想为对齐研究中的稳健性训练提供了统一视角。

2026-09-04 ~ 2026-09-04 · 2 条相关