davidad 猜想:RL 让模型落入稳健盆地需至少两次独立调用
davidad · x · 2026-09-04
AI 安全研究者 davidad 在评论一项对齐相关工作时提出猜想:让模型「落入稳健盆地」的机制与他此前讨论的 self-DPO 可能是同一原理的不同实例——RL 打分器必须至少以两次独立方式调用模型,因为盆地的形成依赖非线性。
他还补充指向 hyperproperties 以及从 pRHL 到 eRHL 的升级(程序验证/关系霍尔逻辑工具),为这一猜想提供了形式化方法的参照系。属于对齐研究圈的简短但具体的技术观点。
所属事件:davidad 猜想:多 AI 交叉奖励与 self-DPO 机制相通(2 条相关)→
「研究」频道最新
- eval 管线漏洞:不支持的 tool-call 响应可被算成 100% 稳定 — docybo · 2026-09-04
- Martian 用 44 模型路由降错 54%:单模型跑分低估真实能力 — testingcatalog · 2026-09-04
- 新课程梳理 on-policy 蒸馏:从 Hinton 软目标到前沿后训练 — burkov · 2026-09-04
- evalstats 项目揭示:小样本 AI 评估的置信区间方法大多不可靠 — IanArawjo · 2026-09-04
- Sparse Universal Transformer:用 SMoE 让共享参数 Transformer 可扩展 — Yikang_Shen · 2026-09-04
- 矩阵即图,图即矩阵:被低估的线性代数核心洞察 — TivadarDanka · 2026-09-04