Elicit推出药物研发推理评测基准
Elicit 发布了全新基准测试 BioDecisionBench,专门用于评估大语言模型在药物研发等高风险决策中的推理表现。该基准包含 40 个任务变体,源自 26 个生命科学复杂推理失败案例,覆盖从靶点选择到临床试验设计的全过程。同时,团队还推出了一套结合模型互审机制的推理纠错系统,以降低 AI 制药决策失误率。
2026-08-06 ~ 2026-08-07 · 3 条相关
- Elicit 推出 BioDecisionBench,专测大模型制药决策推理 — xuanalogue · 2026-08-06
- Elicit 发布 BioDecisionBench:评估 AI 在药物研发高风险决策中的推理能力 — elicitorg · 2026-08-07
- Elicit 推出药物研发推理系统,结合模型互审降低决策失误 — elicitorg · 2026-08-07