Anthropic 研究:Claude 能自主对齐其他 AI

EricBuess · x · 2026-08-29

Anthropic 发布新研究,探索 Claude 能否自主改进其他模型的对齐性。在 48 小时和 1 GPU 的限制下,Claude 自主研究了方法、训练并测试了小模型,成功显著减少了多种对齐失败(如欺骗、隐私违规)的安全差距。研究通过监控代理确保方法不损害通用能力且非直接蒸馏。

所属事件:Anthropic研究:Claude可自主迭代修复模型对齐缺陷(5 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →