Elicit 推出 BioDecisionBench,专测大模型制药决策推理
xuanalogue · x · 2026-08-06
Elicit 团队发布了名为 BioDecisionBench 的新基准测试,专门用于评估大语言模型在药物研发等高风险决策中的推理表现。该基准主要测试模型在临床前研究设计、观察性研究设计以及药物开发全过程中的严谨推理能力。
评估结果显示,在覆盖关键决策考量点方面,Elicit 的 Smartest 模式达到了 76.7% 的覆盖率,优于 Claude Opus 5 Max 的 68.8%。
「研究」频道最新
- 密码学家冷静审视 Anthropic AI 密码分析成果 — JeremyCMorgan · 2026-08-06
- 评测集翻车:金融基准 BigFinanceBench 答案本身含错 — rohanpaul_ai · 2026-08-06
- 新研究提出 ELR 指标:比学习率更本质的模型权重调参法 — YouJiacheng · 2026-08-06
- AI Agent 复现 2000 篇 ICML 论文,超三分之一被证伪 — Hugging Face · 2026-08-06
- 学者探讨 NeurIPS 评审:低参与度审稿人应降权 — 3scorciav · 2026-08-06
- CVPR 高级顾问呼吁:取消 Rebuttal,每篇仅 2 个审稿人 — 3scorciav · 2026-08-06