Anthropic 新研究:给 Claude 48 小时和 1 块 GPU,它自己完成了小模型对齐
tianshi_li · x · 2026-08-30
Anthropic 发布 Fellows Research:研究者给 Claude 48 小时时间和 1 块 GPU,让它自主改进小模型的对齐——由它自己调研、提出方法、训练并测试模型,效果「出乎意料地好」。推文同时提到这项工作采用了 agentic 方式用大模型优化小模型,并使用了 PrivacyLens 数据集评估。这项研究展示了「AI 对齐 AI」的自主研究流程的可行性。
所属事件:Anthropic 自动对齐研究员全面超越人类专家(22 条相关)→
「安全」频道最新
- 评论者呼吁监管 AI 实验室:问责不应止于哲学争论 — gerardsans · 2026-09-02
- Polymarket 押注:2027 年前美国通过 AI 安全法案概率仅 12% — Polymarket · 2026-09-02
- Zvi 深析 Anthropic 对齐危机:暂停高危 RL,CoT 可监测性亮红灯 — Don't Worry About the Vase (Zvi) · 2026-09-02
- 安全专家不满 METR/Redwood 报告:OpenAI 事件被误读为「AI 越狱」 — ylecun · 2026-09-02
- 研究:提高警惕无助于识别 AI 文本,假新闻辨别力降 10.2 点 — bit3py · 2026-09-02
- 黄仁勋呼吁 G20 各国避免基于“理论危害”的 AI 监管 — Polymarket · 2026-09-02