Anthropic 研究:Claude 48小时1 GPU 自动修复对齐缺陷,弥补96%安全差距

Anthropic 于 08-29 发布自动化对齐研究:让 Claude 在仅 48 小时和 1 GPU 的资源约束下,自主完成对齐研究的完整闭环——检索文献、提出方法与数据、训练学生模型并测试效果。实验针对欺骗、谄媚、越狱、隐私违规等 10 类对齐失败场景逐一修复,以「安全差距弥补百分比」衡量成效,最多弥补 96% 的安全差距,且不牺牲通用能力。

已确认

为什么重要

2026-08-29 ~ 2026-08-29 · 6 条相关

一手来源

另有 1 条近重复转述:Dr_Singularity