Anthropic 证实自动化对齐研究员可缓解 AI 对齐失败

Anthropic 发布报告,证实由 Claude 驱动的自动化对齐研究员能够可靠地缓解 AI 对齐失败。研究让 Claude 自主搜索训练后配方并训练模型,以改善在欺骗、奉承、越狱等十项可测量对齐失败基准上的表现,其效果胜过资深人类研究员。

2026-08-31 ~ 2026-09-02 · 2 条相关

事件全程(共 9 集)→