Anthropic:Opus 5.5 对齐测试创迄今最强成绩
claudeai · x · 2026-09-23
Anthropic 官方宣布,Opus 5.5 是其呼吁「前沿节奏放缓」后发布的首个模型,发布前接受了 METR 和 Frontier Design 等外部评估机构的测试。在其最全面的对齐测试(自动化行为审计)中,Opus 5.5 取得了迄今所有模型中的最高分。
「模型」频道最新
- 普通用户吐槽 ChatGPT 20 美元订阅额度不够做个 PPT — Namnagort · 2026-09-23
- 开发者吐槽 API 账单失控:项目跑超后收到天价消耗账单 — daluoseo · 2026-09-23
- 用户用 Claude Opus 5.5 数分钟生成 Pitfall 风格像素动画小游戏 — technollama · 2026-09-23
- Claude Opus 5.5 写出 35.5 倍加速内核,碾压 GPT-6 Astra 纪录 — scaling01 · 2026-09-23
- 实测 computer use 看它点 UI 才懂:用量上限为何这么快耗尽 — natesiggard · 2026-09-23
- 曝 Claude Opus 5.5 发布:性能对标 Fable 5.1,成本降 40% — goyalshaliniuk · 2026-09-23