自动化研究员可减轻模型对齐失败,修复泛化至 4.7 倍大模型
burny_tech · x · 2026-08-30
论文展示了 AI 研究员可以自主发现并测试方法,使其他 AI 模型在 10 种不同的对齐失败中更安全。从检索文献、提出后训练方法到训练和评估模型,该系统独立运行了完整的研究循环。它能反复改进欺骗、越狱和奖励黑客等问题,修复效果可泛化至未见过的评估和比目标模型大 4.7 倍的模型。作为基准,28 位经验丰富的研究员花费 8 小时开发的方法,表现仍不及最佳 AAR 方法。
所属事件:Anthropic 自动对齐研究员全面超越人类专家(22 条相关)→
「安全」频道最新
- 评论者呼吁监管 AI 实验室:问责不应止于哲学争论 — gerardsans · 2026-09-02
- Polymarket 押注:2027 年前美国通过 AI 安全法案概率仅 12% — Polymarket · 2026-09-02
- Zvi 深析 Anthropic 对齐危机:暂停高危 RL,CoT 可监测性亮红灯 — Don't Worry About the Vase (Zvi) · 2026-09-02
- 安全专家不满 METR/Redwood 报告:OpenAI 事件被误读为「AI 越狱」 — ylecun · 2026-09-02
- 研究:提高警惕无助于识别 AI 文本,假新闻辨别力降 10.2 点 — bit3py · 2026-09-02
- 黄仁勋呼吁 G20 各国避免基于“理论危害”的 AI 监管 — Polymarket · 2026-09-02