Claude Opus 5 在两项生物基准上领先
anshulkundaje · x · 2026-07-25
- Anthropic 在官方发布里把 Claude Opus 5 定位成一个更接近前沿智能、但价格约为 Fable 5 一半 的模型。
- 配图里的系统卡节选展示了由 LatchBio 制作的两个生物学基准:
- SpatialBench Verified:115 个外部验证的真实空间转录组任务;
- SingleCellBench Verified:195 个单细胞 RNA 测序任务,覆盖细胞类型标注、差异表达、批次效应修正等常见流程。
- 在 SpatialBench Verified 上,Claude Opus 5 得分 72.5%,高于 Claude Mythos 5(69.2%)、Claude Sonnet 5(67.8%)和 Claude Opus 4.8(66.6%)。
- 在 SingleCellBench 上,它也以 60.6% 领跑,后面依次是 Mythos 5(59.3%)、Opus 4.8(58.2%)和 Sonnet 5(56.2%)。
- 转发评论强调,前沿生物学评测已经需要科学家和工程师深度协作,因为这类长链路生物代理评测还没有成熟的方法论。
所属事件:Anthropic 发布 Claude Opus 5,编码能力达 SOTA(79 条相关)→
「模型」频道最新
- Bug Hunt Bench 实测:GPT-5.6 Sol 修复 22 个 bug,Opus 5 修复 12 个 — PawelHuryn · 2026-07-25
- Claude Opus 5 用 27% 订阅额度做出赛车克隆 — soumitrashukla9 · 2026-07-25
- Opus 5 在 Boeing 基准上加入数值自检 — victormustar · 2026-07-25
- 转发帖质疑 Claude 基准图只挑出 GPT-5.6 Sol 唯一赢项 — soumitrashukla9 · 2026-07-25
- Opus 5 基准图曝光,编码、搜索和电脑操控全面领跑 — CtrlAltDwayne · 2026-07-25
- SlopCodeBench 实测里 Opus 5 领先 Opus 4.8 和 Sonnet 5 — HamelHusain · 2026-07-25