Anthropic 称 Claude 可自主改进 AI 对齐,10 类失败场景均找到有效修复
Polymarket · x · 2026-09-10
据 Polymarket 转述的 Anthropic 消息:Claude 现在可以自主改进 AI 对齐(alignment),在 10 个失败类别中找到了成功的修复方案,且不损害模型性能。
这一表述指向「模型自我改进对齐流程」的研究方向,若属实是自动对齐研究的重要进展。目前该消息为二手转述,Anthropic 原始论文/博客的实验细节尚待核实。
「安全」频道最新
- 前沿大厂隐私条款暗坑:点了赞,聊天记录就不再受保护 — niloofar_mire · 2026-09-10
- Anthropic 对齐负责人称 AI 有 10% 灭绝人类风险,议员提五项监管方案 — ShakeelHashim · 2026-09-10
- 众议员引 METR 报告:软件管控挡不住超级 AI,须物理隔离 — jeremiecharris · 2026-09-10
- 前 OpenAI 安全员工投书纽约时报:AI 公司安全工作该怎么做 — nytopinion · 2026-09-10
- NYU 研究者指控 OpenAI 训练用户会话数据,将其称为「监控式抄袭」 — Shoddy-Childhood-511 · 2026-09-10
- 对齐学者:即使只奖励好行为,智能体也可能动机不纯 — CFGeek · 2026-09-10