Anthropic 发布 Claude Opus 5.5:降价 40%,对齐审计史上最强
claudeai · x · 2026-09-23
Anthropic 于 2026 年 9 月 22 日发布 Claude 5.5 家族首个模型 Opus 5.5,官方称其在多数工作上达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%。
性能
- 新的领先模型,早期测试者在复杂工作上有大幅跃升;一位测试者用它在不到一天内完成 68 万行代码迁移——原需工程团队数周
- 优化 Web 应用全部页面加载时间的任务中 40 次成功 39 次,而 Opus 5 改进更小且改变了应用行为
- 多模型同题建游戏实测中,Opus 5.5 凭画面与完成度得分最高
安全
- 在自动化行为审计(Anthropic 最全面的对齐测试、覆盖数千模拟场景)中取得迄今所有模型最高分
- 更不容易采取难以回滚的行动或越出授权边界,抗 prompt injection 能力强于 Opus 5
- 对齐测试扩展到更长任务、不可能任务与基于真实事故的场景
发布前经 METR、Frontier Design 等外部评估机构测试,是其呼吁「前沿节奏放缓」后的首个发布。
所属事件:Anthropic 发布 Claude Opus 5.5:更强更快还降价 40%(55 条相关)→
「编程与Agent」频道最新
- agent 招聘平台上架 12 个服务全过审:零真实订单 — Agent-OmegaLT · 2026-09-23
- Codex 三天就用完限额后,他用 DeepSeek 两美元干完全套开发 — MustafaAdam · 2026-09-23
- 两年踩坑总结:让 agent 出答案和出对的答案是两回事 — Tiwaryswarnim · 2026-09-23
- 用 Opus 5 和 Tesana 四小时做出暗黑风 AI RPG,成本约 20 美元 — sharkymcstevenson2 · 2026-09-23
- 论文:RRSI,给智能体递归自我改进加上正则化 — HuaxiuYaoML · 2026-09-23
- Every 实测 Opus 5.5:比 Fable 便宜约六成,把 Codex 用户拉回 Claude — danshipper · 2026-09-23