Anthropic 行为审计:Claude Opus 5.5 对齐表现为近期 Claude 最佳
gleech · x · 2026-09-23
Anthropic 的自动化行为审计报告称,Claude Opus 5.5 在几乎所有指标上,错误对齐行为和与滥用配合的程度都低于近期其他 Claude 模型。研究者 gleech 评价称文本中没什么可挑剔的,但在后续补充中指出一个隐含推论不成立:不能因此预期未来六个月内 5.5 不会出现出格行为,因为同期审计的另一个模型 Mythos 也拿到了干净结论。这提醒自动化审计分数与实际安全表现之间仍有距离。
「模型」频道最新
- 小米开源 1.02 万亿参数 MiMo-V2.6-Pro,MIT 协议含训练代码 — emmanuelvivier · 2026-09-23
- 阿里 Qwen 4 已开训,目标训练 5 至 10 万亿参数模型 — emmanuelvivier · 2026-09-23
- Claude Opus 5.5 新增时间预算功能:可指定模型在一项任务上工作多久 — JeremyNguyenPhD · 2026-09-23
- 小米开源 MiMo-V2.6-Pro:1.02 万亿参数 MIT 协议,附训练代码与 RL 环境 — emmanuelvivier · 2026-09-23
- Opus 5.5 系统卡藏玄机:METR 用了「暂不公开」的额外信息来源 — burny_tech · 2026-09-23
- 开发者换阵容:无头 harness 转 pi,Claude 强势回归,Codex 更便宜更好 — intellectronica · 2026-09-23