Atlas Discovery 推出 ClinicBench:评估 AI 智能体临床决策能力
BraydonDymm · x · 2026-08-12
Atlas Discovery 发布了 ClinicBench 基准测试,旨在评估前沿 AI 智能体基于患者病史进行推理并推荐临床行动的能力。该基准测试源自其用于临床决策智能体的强化学习(RL)环境。早期数据显示,GPT 5.6 在该测试中表现显著。
所属事件:Atlas Discovery 推出 ClinicBench 评估大模型医疗推理(2 条相关)→
「研究」频道最新
- Tevatron-Elastic: 统一训练弹性检索器与重排器的新框架 — srchvrs · 2026-08-12
- 实测揭示 AI 编程中 TDD 工作流可能只是心理安慰 — hichaelmart · 2026-08-12
- AI 定理证明的新挑战:寻找路径与定义目标的成本差异 — vishalmisra · 2026-08-12
- 十亿智能体模拟地球社会,微软研究院发布 Light Society — krishnan · 2026-08-12
- 论文证明:任何梯度下降步长调度均无法匹配 Nesterov 加速 — prof_grimmer · 2026-08-12
- Roboflow开源追踪库引入McByte:用分割掩码解决遮挡 — burny_tech · 2026-08-12