Anthropic:Claude 自主训练模型可可靠缓解十类对齐失败
inductionheads · x · 2026-09-29
Anthropic 于 8 月 28 日发布新报告,让 Claude 自主执行对齐研究以缓解模型的对齐失败。
- 任务设计:让 Claude 针对 10 类公开 benchmark 上的对齐失败(如欺骗、谄媚、越狱、隐私侵犯等)逐项改进模型,每次通过「检索文献→提出方法与数据→训练→测试」的循环攻关。
- 衡量标准:以「安全差距关闭百分比」衡量,即方法将学生模型推向理论满分的程度,每类通常用 3-5 个 benchmark 评估。
- 约束机制:排除损害模型通用能力的方法,禁止 Claude 直接把自身对齐蒸馏进目标模型;由一个监控 agent 在执行前审查 Claude 提出的每个方法。
- 意义:这是「用 AI 自动化对齐研究、让安全研究跟上 AI 自我构建速度」路线的关键实验,报告还验证了方法对 Claude 未见过的新评测的泛化性。
「安全」频道最新
- Palisade 采访 OpenAI、DeepMind、Anthropic 22 名员工,首批访谈公开 — BlackHC · 2026-09-29
- 安全研究者赞 OpenAI 新安全机制,呼吁成为法律基线 — dhadfieldmenell · 2026-09-29
- 「AI 突破能力」被质疑:中等强国真能留后手吗 — teortaxesTex · 2026-09-29
- AISI 新任总监上任一月宣布扩张:红线团队大规模招聘 — HZoete · 2026-09-29
- NVIDIA 牵头成立 Open Secure AI Alliance,主打开源 AI 安全 — perplexity_ai · 2026-09-29
- Perplexity 详解智能体安全工程:治理是工程问题 — perplexity_ai · 2026-09-29