自动化研究员可减轻模型对齐失败,修复泛化至 4.7 倍大模型

burny_tech · x · 2026-08-30

论文展示了 AI 研究员可以自主发现并测试方法,使其他 AI 模型在 10 种不同的对齐失败中更安全。从检索文献、提出后训练方法到训练和评估模型,该系统独立运行了完整的研究循环。它能反复改进欺骗、越狱和奖励黑客等问题,修复效果可泛化至未见过的评估和比目标模型大 4.7 倍的模型。作为基准,28 位经验丰富的研究员花费 8 小时开发的方法,表现仍不及最佳 AAR 方法。

所属事件:Anthropic 自动对齐研究员全面超越人类专家(22 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →