Anthropic 新研究:给 Claude 48 小时和 1 块 GPU,它自己完成了小模型对齐

tianshi_li · x · 2026-08-30

Anthropic 发布 Fellows Research:研究者给 Claude 48 小时时间和 1 块 GPU,让它自主改进小模型的对齐——由它自己调研、提出方法、训练并测试模型,效果「出乎意料地好」。推文同时提到这项工作采用了 agentic 方式用大模型优化小模型,并使用了 PrivacyLens 数据集评估。这项研究展示了「AI 对齐 AI」的自主研究流程的可行性。

所属事件:Anthropic 自动对齐研究员全面超越人类专家(22 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →