Anthropic 实测自动化对齐研究员:Claude 智能体可缓解十类对齐失败
echen · x · 2026-09-16
Anthropic 发布新报告,让 Claude 智能体自主执行对齐研究闭环:检索文献、提出方法、训练模型、评估结果并迭代。
- 针对欺骗、谄媚、越狱、隐私侵犯、reward hacking 等十类对齐失败逐一改进
- 以「安全差距关闭百分比」衡量,排除损害通用能力的方法,并用监控智能体审查 Claude 提出的每个方法
- 自动化研究员找到的方法在保留通用能力的同时提升安全基准,最强方法可泛化到留出基准、Petri 开放式审计、以及比优化对象大 4.7 倍的模型
- 与 28 位资深 AI 安全研究者的 8 小时人工提案做了对比;Surge 负责构建人类基线
「安全」频道最新
- Bitsec 多模型组合找出 160+ 漏洞,胜过单一“超人”模型 — markjeffrey · 2026-09-16
- 牛津学者播客谈Meta监控诉讼:AI预测正替我们决定未来 — CarissaVeliz · 2026-09-16
- Pedro Domingos 讽刺:欧洲 AI Act 是人类没灭绝的唯一原因 — pmddomingos · 2026-09-16
- 调查称 EA 金主买通媒体:卫报 AI 报道 6 名相关者全受同一资金圈资助 — beffjezos · 2026-09-16
- AI 2027 作者发布「Plan A」:推迟超级智能到2040年,全面公开AI研究 — Turn_Trout · 2026-09-16
- Nahom Sisay:EA 操纵媒体叙事,公众对 AI 的认知被末日头条绑架 — NathanpmYoung · 2026-09-16