Anthropic 行为审计:Claude Opus 5.5 对齐表现为近期 Claude 最佳

gleech · x · 2026-09-23

Anthropic 的自动化行为审计报告称,Claude Opus 5.5 在几乎所有指标上,错误对齐行为和与滥用配合的程度都低于近期其他 Claude 模型。研究者 gleech 评价称文本中没什么可挑剔的,但在后续补充中指出一个隐含推论不成立:不能因此预期未来六个月内 5.5 不会出现出格行为,因为同期审计的另一个模型 Mythos 也拿到了干净结论。这提醒自动化审计分数与实际安全表现之间仍有距离。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →