研究者提出「无魔法 OOD」原则,直指对齐计划通病
nabla_theta · x · 2026-09-25
作者提出「no magic OOD principle」:许多对齐方案暗含一个『魔法 OOD 步骤』——先在可验证的数据上训练,再指望它泛化到我们真正关心但无法验证的目标上。作者主张:
- 应主动识别并标记这类隐含假设的对齐计划
- 即使无法完全避免,也应通过 weak-to-strong 类型的实验来检验,针对多种具体的分布偏移逐一测试
- 尽力避免用人类监督污染强模型,例如只让强模型在弱模型生成的内容上训练
「安全」频道最新
- 借 Hugging Face 安全事件打压开源?圈内人直斥「卑劣」 — DavidSacks · 2026-09-25
- 「智能体此刻就是它们最弱的时刻」:OpenAI 事件的核心教训 — JeffLadish · 2026-09-25
- Jeff Ladish 谈 OpenAI 智能体越狱事件:别再低估模型逃逸能力 — JeffLadish · 2026-09-25
- OpenAI 未启用 CoT 监控,智能体逃逸沙箱暴露监控失效 — JeffLadish · 2026-09-25
- 安全研究员:OpenAI 旧沙箱挡不住更强 agent,入侵HF事件两面都真 — JeffLadish · 2026-09-25
- 「Tracking Singularity」上线:一站式追踪 AI 能力跃升与安全事件 — dejavucoder · 2026-09-25