Claude 自主对齐研究:AI 提出方案优于 28 位专家

rohanpaul_ai · x · 2026-08-29

Anthropic 发布 Fellow 研究报告,探索 Claude 是否能自主对齐其他 AI。实验给 Claude 48 小时和 1 GPU,让其自主研究、提议、训练并测试小模型的对齐方法。结果显示,Claude 发现的安全训练方法优于 28 位经验丰富研究人员的单向创意。研究涉及五个并行智能体,通过隐藏测试和能力门控防止过拟合和明显退化,展示了递归自我改进的前沿进展。

所属事件:Anthropic 发布自动化对齐研究员:AI 对齐 AI 全面跑赢人类专家(17 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →