Astra 实测临床基准仍不敌 Anthropic,智能呈尖峰分布
danielmckinn0n · x · 2026-09-06
作者在自建临床遗传学基准 RareBench 上实测后认为,Astra 并非新范式,只是对 Sol 的渐进式改进,仍落后于 Anthropic 的 Fable 5.1。
要点:
- RareBench、GeneBench-Pro、MedChemBench 等临床/生命科学任务依然远未饱和,新模型智能呈「尖峰分布」,并非全面跃升。
- Artificial Analysis 将基准调整为惩罚疑似过拟合的 Meta Muse Spark 1.3 Max 一事,与作者实测结论一致:Max 版仅小幅提分,Meta 仍明显落后前沿。
- 作者建议 Artificial Analysis 将 RareBench 纳入盲测集。
「模型」频道最新
- 传 Anthropic 已解决千禧年大奖难题,陶哲轩发文回应引热议 — littmath · 2026-09-06
- 研究:前沿 AI 修安全漏洞成功率仅约 1/4,不宜自动信任 — Evgenii42 · 2026-09-06
- 大胆预测:GPT-6 Luna/Terra 每月 20 美元自动化大部分电脑工作 — xhluca · 2026-09-06
- Gemini 3.8 Flash 登场:DeepSWE 得分 73.7%,成本持平 — burny_tech · 2026-09-06
- 「全息甲板」之争:程序化世界加生成式光照或是终局路线 — dreamwieber · 2026-09-06
- Ethan Mollick 重评《Sparks of AGI》:从 GPT-4 到 GPT-6 应获正名 — emollick · 2026-09-06