Anthropic 发布 Claude Opus 5.5:比 Opus 5 便宜 40%,680K 行代码迁移一天完成
evilrabbit_ · x · 2026-09-23
Anthropic 发布 Claude 5.5 家族首款模型 Claude Opus 5.5,性能达到 Fable 5.1 水平,运行成本比 Opus 5 低 40%,并经过 Frontier Design、METR 等外部评测机构发布前测试,官方称其为迄今对齐行为审计表现最强的模型。
要点:
- 性能:早期测试者用它在一天内完成 68 万行代码迁移(原需工程团队数周);对 Web 应用全页面提速任务 40 次成功 39 次,且不改变应用行为;单 prompt 建游戏测试中图形与完成度得分超其他所有模型。
- 安全:在数千个模拟场景的行为审计中得分历史最佳,更少执行难以逆转的操作,抗 prompt injection 能力强于 Opus 5,对齐测试扩展到更长任务与真实事故场景。
- rauchg 转发称赞其发布品味,认为 AI 时代网页设计没有理由不突破边界。
所属事件:Anthropic 发布 Claude Opus 5.5:更强且降价 40%(51 条相关)→
「模型」频道最新
- Scaling01 断言:.0 版本必翻车,.5 版本才是真王者 — scaling01 · 2026-09-23
- Opus 5.5 评测表脚注曝光:部分任务实为旧款 Claude 代跑完成 — airesearch12 · 2026-09-23
- 博主实测后改口:Opus 5.5 在 Game Boy 测试上表现更合口味 — Angaisb_ · 2026-09-23
- Claude Opus 5.5 特殊设计:前沿开发类能力会降级到弱模型 — akbirthko · 2026-09-23
- Opus 5.5 审计修复 20 万行代码库不到 3 小时,token 还省 2.5 倍 — minchoi · 2026-09-23
- CursorBench 实测:Opus 5.5 成本仅 Fable 5.1 六分之一还能反超 — haider1 · 2026-09-23