Claude 尝试自主对齐小模型,效果惊人

niloofar_mire · x · 2026-08-30

Anthropic 发布研究员报告,测试 Claude 能否在 48 小时内利用 1 个 GPU 自主改善小模型的对齐性。过程包括研究方法、提出方案、独立训练和测试。结果显示其效果出奇地好,证明了 AI 在自动化对齐工作流中的潜力。转发者同时提到其团队的 Confaide benchmark 正被用于提升模型安全性。

所属事件:Anthropic 自动对齐研究员全面胜出人类专家,成本仅 1/37(22 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →