Elicit推出药物研发推理评测基准

Elicit 发布了全新基准测试 BioDecisionBench,专门用于评估大语言模型在药物研发等高风险决策中的推理表现。该基准包含 40 个任务变体,源自 26 个生命科学复杂推理失败案例,覆盖从靶点选择到临床试验设计的全过程。同时,团队还推出了一套结合模型互审机制的推理纠错系统,以降低 AI 制药决策失误率。

2026-08-06 ~ 2026-08-07 · 3 条相关