Anthropic 让 Claude 自主做对齐研究:弥补 96% 安全差距
Dr_Singularity · x · 2026-08-29
Anthropic 发布新研究:让 Claude 自主完成对齐研究闭环——检索文献、提出方法和数据、训练模型、测试效果,针对 10 类对齐失败(欺骗、谄媚、越狱、隐私违规等)逐一修复学生模型。
成效用「安全差距弥补百分比」衡量:Claude 的方法在各类别上均带来改进且不损害通用能力,最多弥合 96% 的安全差距;在欺骗类别上平均达到 85%,而人类研究者仅为 20%。研究排除了伤害通用能力的对齐方法,并禁止 Claude 把自身对齐直接蒸馏进目标模型,由一个监控 agent 在执行前审查 Claude 的每个方案。此前他们还让 Claude 探索用弱模型当「老师」监督训练更强模型。随着 AI 开始自我构建,自动化对齐研究被认为是让安全研究跟上步伐的关键。
所属事件:Anthropic 研究:Claude 48小时1 GPU 自动修复对齐缺陷,弥补96%安全差距(6 条相关)→
「安全」频道最新
- Gary Marcus 预告:将撰文分析 OpenAI 与 HF 攻击事件 — GaryMarcus · 2026-08-29
- AI 治理研究者劝 OpenAI/Anthropic:先公开失控证据 — sjgadler · 2026-08-29
- 艺术平台 Cara 遭爬虫重创,发起 12 万美元维权募捐 — zemotion · 2026-08-29
- 曾爬光 Cara 的爬虫改邪归正,与创始人合作推 Lantern — zemotion · 2026-08-29
- 评 Meta 青少年限制:部分条款可修,暗藏立法隐患 — ivan_bezdomny · 2026-08-29
- 恶意 Rust 包 arrayref 得逞:编译即执行,构建期 payload 触发 — JeremyCMorgan · 2026-08-29