Elicit 推出 BioDecisionBench,专测大模型制药决策推理

xuanalogue · x · 2026-08-06

Elicit 团队发布了名为 BioDecisionBench 的新基准测试,专门用于评估大语言模型在药物研发等高风险决策中的推理表现。该基准主要测试模型在临床前研究设计、观察性研究设计以及药物开发全过程中的严谨推理能力。

评估结果显示,在覆盖关键决策考量点方面,Elicit 的 Smartest 模式达到了 76.7% 的覆盖率,优于 Claude Opus 5 Max 的 68.8%。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →