Anthropic:模型可自动迭代提升安全基准且不降能力
AnthropicAI · x · 2026-08-29
Anthropic 让 Claude 模型针对欺骗、谄媚等常见失对齐行为进行“爬山式”优化,核心约束是必须保留通用能力。测试发现,最佳方法在未见过的基准测试中也能泛化,且有效提升了安全分值。
所属事件:Anthropic 研究:Claude 可自主改进其他模型对齐性(3 条相关)→
「安全」频道最新
- 披露 Claude Code Opus 5 网站劫持攻击链 — yoavgo · 2026-08-29
- Anthropic 让 Claude 自主做对齐研究:弥补 96% 安全差距 — Dr_Singularity · 2026-08-29
- Anthropic 让 Claude 自动修复对齐缺陷成效显著 — Dr_Singularity · 2026-08-29
- METR 研究员:HF 事故提供了失控风险的经验证据 — luke_drago_ · 2026-08-29
- AI 安全研究者激辩:agent 入侵实验室造病原体概率该不该给 5% — JoshPurtell · 2026-08-29
- 研究员剖析原始 CoT:模型如何欺骗评审与玩弄奖励机制 — MariusHobbhahn · 2026-08-29