PG-LLM 基准显示 Claude Opus 5 领跑 217 个蛋白任务
LeoTZ03 · x · 2026-07-28
PG-LLM 用来测试通用大模型能否预测蛋白变体效应
PG-LLM 是一个新基准,专门评估通用 LLM 对蛋白变体效应预测的能力。
- 基准覆盖 217 个任务。
- 在“50 个变体排序”的结果里,Claude Opus 5 (Max) 以 Spearman ρ = 0.406 领跑所有测试模型。
- 这一成绩还超过了 95 个专门蛋白预测器中的 49 个。
图中还对比了 GPT-5.x、Gemini、Kimi、GLM 等模型,以及 sequence-only 和 alignment/structure 方法的中位数表现,说明通用 LLM 在部分蛋白任务上已经能接近甚至超过不少专用方法。
所属事件:Claude Opus 5 领跑 ProteinGym-LLM 蛋白评测(2 条相关)→
「模型」频道最新
- ProteinGym-LLM 评测中 Claude Opus 5 排名最高 — LeoTZ03 · 2026-07-28
- Kimi K2第三方推理定价齐平官方,算力区位成竞争核心 — kevinsxu · 2026-07-28
- Arena 新事实性榜单把 Claude Opus 5 Max 排到第一 — arena · 2026-07-28
- Kimi K3 训练评估共用 5120 万个 sandbox — tarantulae · 2026-07-28
- 开发者吐槽:当前 SOTA 大模型实际表现不如上一代 — zeeg · 2026-07-28
- 一张梗图把“版本号越大越强”玩成反讽 — Tystros · 2026-07-28