罕见病诊断基准 RareBench 横评:Claude Fable 5.1 居首,Nemotron 3 Ultra 得 0 分
danielmckinn0n · x · 2026-09-05
作者介绍独立评测集 RareBench:仅凭基因组与表型信息诊断儿童罕见病,考察各家模型的推理与 agentic 工具调用能力(作者称厂商大概率还没针对它刷榜)。
主要结果:
- Anthropic Claude Fable 5.1 排名第一,微弱领先 Fable 5.0,保持统治地位。
- Google Gemini 3.8 相比 3.7 出现回退,且在一部分题目上多次重试后超时;结合其他独立评测也报告的 token 消耗异常增加,作者怀疑这次发布内部出了问题,尽管公开跑分很好看。
- Meta Muse 1.3 较 1.2 巨幅提升,但仍明显落后前沿。
- NVIDIA Nemotron 3 Ultra 出人意料地得了 0%,作者反复核查无误:其推理与工具调用在该任务上基本不可用。
- Qwen 3.8 27B 并非有人宣称的 Opus 级别,但显著优于其他小模型,具备用 RL 拉到可用水平的潜质。
- 作者还加入传统临床预测器 LIRICAL、PhenIX、Exomiser 作对照:它们预测的是基因而非变异(任务更简单),却仍明显跑不过现成 AI agent——印证 OpenAI 近期在 NEJM 论文的观点:消费级 AI 工具已超越传统医疗软件。
「模型」频道最新
- GPT-6 Astra 生成 COD 风格射击游戏,用户连玩 2 小时边玩边改 — thisiskp_ · 2026-09-05
- Reddit 用户算账:$200 档 OpenAI 用量是 $100 档的四倍而非两倍 — leebase65 · 2026-09-05
- LMArena 图像编辑排行榜上线,可对比各模型修图能力 — arena · 2026-09-05
- Claude 太贵,知识工作者求推荐长上下文强指令跟随的替代模型 — SemiMagnum · 2026-09-05
- Every 团队直播实测 Anthropic Fable 5.1 与 OpenAI GPT-6 Astra — danshipper · 2026-09-05
- 用户实测质疑 Artificial Analysis 榜单:高分模型实战远逊 Opus — PerformanceRound7913 · 2026-09-05