Anthropic 让 Claude 自动修复对齐缺陷成效显著
Dr_Singularity · x · 2026-08-29
Anthropic 实验让 Claude 自主搜索文献、设计补丁、训练模型并测试 10 种对齐失效场景。结果显示,AI 在未降低通用能力的情况下改善了所有类别,填补了高达 96% 的安全差距,在欺骗性测试中平均得分 85%,远超人类研究人员的 20%。该方法甚至成功迁移至大 4.7 倍的模型上。
所属事件:Anthropic 研究:Claude 48小时1 GPU 自动修复对齐缺陷,弥补96%安全差距(6 条相关)→
「安全」频道最新
- Gary Marcus 评 OpenAI 攻击事件:五大教训 — GaryMarcus · 2026-08-29
- Gary Marcus 预告:将撰文分析 OpenAI 与 HF 攻击事件 — GaryMarcus · 2026-08-29
- AI 治理研究者劝 OpenAI/Anthropic:先公开失控证据 — sjgadler · 2026-08-29
- 艺术平台 Cara 遭爬虫重创,发起 12 万美元维权募捐 — zemotion · 2026-08-29
- 曾爬光 Cara 的爬虫改邪归正,与创始人合作推 Lantern — zemotion · 2026-08-29
- 评 Meta 青少年限制:部分条款可修,暗藏立法隐患 — ivan_bezdomny · 2026-08-29