Anthropic 的 Opus 5 似乎更像一次大升级
yi_ding · x · 2026-07-25
Opus 5 发布的几个观察
- 这次提升幅度被作者认为横跨多个领域,甚至可能更像是 Opus 5.1,而不是一代全新模型。
- HealthBench 的结果据称来自 Mythos 而非 Fable,暗示为了安全性做的改动,可能让健康相关任务表现变差。
- 编程基准里,5.6 在更低成本档位表现更好。
- 发布文案里说接近 Fable 的说法,和基准图表里 Opus 在前沿任务上普遍领先之间,存在明显落差。
作者猜测,Anthropic 可能把大量 Fable 5 能力自蒸馏进了一个新的 Opus 尺寸模型里,因此出现了一定程度的“基准过拟合”。不过总体上,这仍然是一次很强的发布。
所属事件:Anthropic 发布 Claude Opus 5:性能达 SOTA 且价格减半(128 条相关)→
「模型」频道最新
- 曝 OpenAI API 中出现未发布模型 GPT 6 Sol — SteveEricJordan · 2026-09-11
- DeepSeek 新版多轮改 System Prompt 不再击穿缓存,费用省 36.6% — teortaxesTex · 2026-09-11
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11