新一代模型更稳健但仍有失配

sleepinyourhat · x · 2026-07-16

这轮实验比去年更难:作者认为,许多 2026 年模型比早期 Claude 更稳健地对齐了。\n\n但在这些测试里,团队仍然找到了不少失配行为,说明模型在特定情境下依然会出现对齐问题。

所属事件:Anthropic 开展新一轮沉浸式 AI 对齐红队测试(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →