RadLE 2.0:医疗自主诊断基准发布

DrDatta_AIIMS · x · 2026-07-13

这是 RadLE 2.0 的主帖:一个面向放射学自主诊断的视觉推理基准,目标不是只测“模型能答对多少”,而是评估模型在医疗场景里是否知道何时该停、何时该交给人类医生。

作者发布了五个核心指标:

线程里还提到,他们把 OpenAI、Anthropic、Meta、Google DeepMind、xAI、NVIDIA、阿里 Qwen、Mistral、MiniMax 等家的前沿/开源/医疗 VLM 都放进了排行榜,但没有任何模型达到平均人类专家基线。

所属事件:RadLE 2.0发布:医疗AI评测聚焦不确定性(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →