davidad 猜想:多 AI 交叉奖励与 self-DPO 机制相通
AI 安全研究者 davidad 在评论 Andrew Koh 等人的新论文时提出猜想:让模型落入稳健盆地的机制,可能与他此前讨论的 self-DPO 是同一原理的两个实例。他进一步推测,RL 打分器若要让模型进入稳健盆地,可能需要对模型进行至少两次独立调用,以此获得交叉验证式的奖励信号。该猜想为对齐研究中的稳健性训练提供了统一视角。
2026-09-04 ~ 2026-09-04 · 2 条相关
- davidad 提出猜想:多 AI 交叉奖励与 self-DPO 共享同一机制原理 — davidad · 2026-09-04
- davidad 猜想:RL 让模型落入稳健盆地需至少两次独立调用 — davidad · 2026-09-04