Opus 5 在九项生物基准登顶,但仍有几项分析任务落后
kenbwork · x · 2026-07-25
一组针对 Opus 5 的 9 项 agentic biology 基准测试显示,它在多项任务上都拿到了目前最好的结果,涵盖变体发现、临床前药理、基因组监测和长程单细胞分析等方向。
主要结果
- 变体发现与解释:比 Sol 5.6 高 7.6 个百分点
- 小分子临床前药理:比 Sol 高 7.0 个百分点
- 基因组监测:比 Sol 高 7.3 个百分点
- 长程单细胞分析:比 Sol 高 3.2 个百分点
这份分析认为,Opus 5 在整套测试中超过了此前所有 Anthropic 模型,在 7 项基准里拿下 6 项,通常领先 Opus 4.8 8 到 16 分。但它并非全面碾压:
- 在 短程单细胞分析 上,它以 60.1% vs 62.1% 落后 Sol 5.6 两分。
- 在 长程空间生物学 上,它比 Opus 4.8 高出一倍多(25.0% vs 11.1%),但仍不及 Sol(38.9%)。
- 在 表观基因组分析 上也出现回退,Opus 4.8 反而高 4.2 分。
这条帖是在转述一篇更完整的生物学能力分析,相关基准结果已上线 benchmarks.bio。
「模型」频道最新
- Claude Opus 5 已能生成接近顾问水准的表格和幻灯片 — alexalbert__ · 2026-07-25
- Claude Opus 5 知道背景却仍会误读整份文档 — teortaxesTex · 2026-07-25
- 早期反馈称 Opus 5 文字输出更像“4o 式水文”,但底层更聪明 — jdjohnson · 2026-07-25
- 有人反馈 Anthropic 新模型比 Fable 更快也更强 — emax · 2026-07-25
- 发布博客预告:FrontierCode 智能体编码基准打平 — hardmaru · 2026-07-25
- 网友质疑 Anthropic 针对 ARC-AGI-3 评测进行特化训练 — VraserX · 2026-07-25