Opus 5 上线,健康问答和多项基准成绩同步曝光
JeremyNguyenPhD · x · 2026-07-25
帖子称 Opus 5 已经上线,并特别指出它不像 Fable 那样回避医疗问题,而是可以回答健康相关提问。
配图是一张模型对比表,展示 Opus 5 与 Fable 5、Opus 4.8、GPT-5.6 Sol 在多项基准上的成绩:
- Agentic terminal coding:43.3%
- Knowledge work(GDPval-AA v2):1861
- Novel problem-solving(ARC-AGI-3):30.2%
- Agentic search:90.8%
- Multidisciplinary reasoning:无工具 56.3%,有工具 64.7%
- Computer use:70.6%
- Agentic coding:DeepSWE v1.1 为 68.8%,FrontierCode v1.1 Main 为 53.4%
- Business workflows:26.0%
- Legal:11.7%
- Health:59.8%
- Biology:hard 49.4%,human solved 90.1%
这张图想传达的重点是:Opus 5 在 agentic search、电脑操作和部分推理/生物类任务上表现突出,同时还强化了健康问答能力。
所属事件:Anthropic 发布 Claude Opus 5(97 条相关)→
「模型」频道最新
- Anthropic 评测图显示 Claude Opus 5 约 163.5 分 — scaling01 · 2026-07-25
- Grok 4.5 下调缓存读价格,单任务成本降 25% — Baconbrix · 2026-07-25
- Reddit 称 Claude Opus 5 在 3D 破坏测试中胜过 Fable 5 — Successful-Earth678 · 2026-07-25
- Claude 可能不再显示总结版思考轨迹 — emollick · 2026-07-25
- ParseBench显示Opus 5文档理解接近4.8,但表格与价格不占优 — llama_index · 2026-07-25
- 图表显示 Claude Opus 5 在 kernel 任务上达到 449.46× 加速 — scaling01 · 2026-07-25