Anthropic 发布 Claude Opus 5:编码与知识工作登顶,成本减半
dl_weekly · x · 2026-07-31
Anthropic 正式发布 Claude Opus 5。该模型在多项编码与知识工作基准测试中创下新纪录,性能逼近甚至超越此前的旗舰模型 Fable 5,但成本仅为其一半。
- 核心性能:在 Frontier-Bench v0.1 和 CursorBench 3.2 等测试中表现领先;在 ARC-AGI 3(新颖问题解决)上得分是次优模型的 3 倍;在 OSWorld 2.0(计算机使用)上也表现优异。
- 成本与效率:提供可调的 effort 设置,允许在智能程度与 token 消耗间灵活权衡,实现极高的性价比。
- 安全与可用性:创下迄今最低的 misalignment(不对齐)得分。现已成为 Claude Max 的默认模型及 Claude Pro 的最强模型。
「模型」频道最新
- 开发者质疑 Opus 5 评测作弊:ML 任务体验极差 — ostrisai · 2026-07-31
- Transluce发布WeirdChat,收录17万条大模型异常行为 — ChowdhuryNeil · 2026-07-31
- 图表揭示大模型性价比飞跃:极低成本即可获高智能 — downingARK · 2026-07-31
- AI 太空竞赛实测:GPT-5.6 得分 13% 创纪录,Kimi K3 仅 5.2% — scaling01 · 2026-07-31
- 曝 OpenAI GPT-5.6 实现自我优化:服务成本降 20% — tszzl · 2026-07-31
- 学者激辩 Scaling Law:模型变强但泛化变差? — davidmanheim · 2026-07-31