Elicit 发布 BioDecisionBench:评估 AI 在药物研发高风险决策中的推理能力
elicitorg · x · 2026-08-07
Elicit 推出了 BioDecisionBench,一个包含 40 个任务变体的基准,源自 26 个生命科学复杂推理失败案例,覆盖药物开发从靶点选择到临床试验设计的全过程。该基准旨在评估 AI 在证据模糊、信息有限的高风险决策中的推理能力,而不仅仅是最终答案。现有基准往往只评估最终答案,忽略了推理过程。
所属事件:Elicit推出药物研发推理评测基准(3 条相关)→
「研究」频道最新
- 在物理 Atari 设备上运行强化学习 — k7agar · 2026-08-07
- 智能体架构探讨:智能应存在于模型还是外部工具中? — AndrewLampinen · 2026-08-07
- 美国财政部提供 12 万 PDF,推出 OfficeQA Pro V2 基准 — jefrankle · 2026-08-07
- 硬件神经流形结合机器学习,仅用4帧预测癫痫发作 — bravo_abad · 2026-08-07
- Reka AI 发布 RekaDaily-10k 真实家庭视频数据集 — RekaAILabs · 2026-08-07
- mLateOn模型未训练韩语却登顶 MTEB 韩语检索榜首 — IgorCarron · 2026-08-07