医疗诊断基准RadLE 2.0发布

shuyanzh36 · x · 2026-07-14

这条内容围绕 Radiology’s Last Exam 2.0(RadLE 2.0) 展开,这是一个面向自主 AI 诊断的、带不确定性意识的放射学视觉推理基准。

帖子强调几个重点:

转发里提到,Muse Spark 1.1 在 RadLE 上超过了 GPT-5.6 Sol 和 Gemini 3.1,但仍然没有超过 Fable,也明确表示人类医生目前依然更强。整体论点是:在把 AI 交给更高自治权之前,“会不会自知该停”比单纯分数更重要。

所属事件:RadLE 2.0发布:医疗AI评测聚焦不确定性(8 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →