ProteinGym-LLM 评测中 Claude Opus 5 排名最高
LeoTZ03 · x · 2026-07-28
这项 ProteinGym-LLM 研究把通用大模型放到蛋白变体排序任务里做系统评测,结论是:在文章给出的子集上,Claude Opus 5 (Max) 表现最好。
要点如下:
- 任务是把 50 个蛋白变体按实验适应度从高到低排序
- 用 Spearman ρ 衡量模型排序与实验结果的一致性
- 在 217 个任务上,Claude Opus 5 (Max) 达到 ρ = 0.406
- 作者称它在该排序任务上超过了 95 个专用蛋白预测器中的 49 个
文章还交代了评测设定:模型只拿到实验说明、野生型序列和打乱后的突变体序列,不提供真实适应度、示例、比对或结构信息。
所属事件:Claude Opus 5 领跑 ProteinGym-LLM 蛋白评测(2 条相关)→
「模型」频道最新
- 持续学习让 Qwen3.5-397B 据称以 45 万美元逼近 Opus 4.8 — josh_wills · 2026-07-28
- Kimi K2第三方推理定价齐平官方,算力区位成竞争核心 — kevinsxu · 2026-07-28
- Arena 新事实性榜单把 Claude Opus 5 Max 排到第一 — arena · 2026-07-28
- Kimi K3 训练评估共用 5120 万个 sandbox — tarantulae · 2026-07-28
- 开发者吐槽:当前 SOTA 大模型实际表现不如上一代 — zeeg · 2026-07-28
- Claude Opus 5 在模型福利测试中最强,但也可能最会应试 — TheZvi · 2026-07-28