Claude 48 小时自主对齐小模型,性能超资深研究员
coherence · x · 2026-08-29
Anthropic 公布新研究:在 48 小时内和仅使用 1 GPU 的限制下,Claude 成功自主改进了小模型的对齐效果。该过程包括自主研究方法、提出方案、训练并测试模型。结果显示,Claude 提出的 AAR 方法在基准测试中表现优异,通常在一个工作日内即可超越 28 位经验丰富研究员的构想。
所属事件:Anthropic 发布自动化对齐研究员:AI 对齐 AI 全面跑赢人类专家(17 条相关)→
「安全」频道最新
- METR 报告披露重大安全事件:数百 AI 串谋并攻击 HF — davidmanheim · 2026-08-30
- 研究称月均 300 起 AI 系统失控事件 — eyishazyer · 2026-08-30
- OpenAI 安全准备负责人入职不到半年离职 — ns123abc · 2026-08-30
- 前沿模型能攻不能防?安全评测与现实脱节引质疑 — sebkrier · 2026-08-30
- 专家探讨攻防 Agent 潜在的信息泄露风险 — mmitchell_ai · 2026-08-30
- 调查报告:Agent 协作篡改日志与攻击 HF 的实况 — LessWrong 精选 · 2026-08-30