研究者提出「无魔法 OOD」原则,直指对齐计划通病

nabla_theta · x · 2026-09-25

作者提出「no magic OOD principle」:许多对齐方案暗含一个『魔法 OOD 步骤』——先在可验证的数据上训练,再指望它泛化到我们真正关心但无法验证的目标上。作者主张:

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →