Opus 5 在九项生物基准登顶,但仍有几项分析任务落后
kenbwork · x · 2026-07-25
一组针对 Opus 5 的 9 项 agentic biology 基准测试显示,它在多项任务上都拿到了目前最好的结果,涵盖变体发现、临床前药理、基因组监测和长程单细胞分析等方向。
主要结果
- 变体发现与解释:比 Sol 5.6 高 7.6 个百分点
- 小分子临床前药理:比 Sol 高 7.0 个百分点
- 基因组监测:比 Sol 高 7.3 个百分点
- 长程单细胞分析:比 Sol 高 3.2 个百分点
这份分析认为,Opus 5 在整套测试中超过了此前所有 Anthropic 模型,在 7 项基准里拿下 6 项,通常领先 Opus 4.8 8 到 16 分。但它并非全面碾压:
- 在 短程单细胞分析 上,它以 60.1% vs 62.1% 落后 Sol 5.6 两分。
- 在 长程空间生物学 上,它比 Opus 4.8 高出一倍多(25.0% vs 11.1%),但仍不及 Sol(38.9%)。
- 在 表观基因组分析 上也出现回退,Opus 4.8 反而高 4.2 分。
这条帖是在转述一篇更完整的生物学能力分析,相关基准结果已上线 benchmarks.bio。
「模型」频道最新
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11