RadLE 2.0发布:医疗AI评测聚焦不确定性

面向放射学自主诊断的视觉推理基准 RadLE 2.0 正式发布。与单纯比拼准确率的传统评测不同,该基准重点衡量模型在医疗场景中的不确定性感知能力:即何时应该继续作答,何时应该停下并交给人类医生。这使评测更贴近真实的临床风险控制需求。

核心指标设计

据 @DrDattaAIIMS 介绍,RadLE 2.0 发布了多项核心指标以全面评估“自主级”医疗 AI。其中,RadLE-C(Confidence Weighted)侧重置信度加权后的整体表现;RadLE-R(Reliability Index)衡量模型给出“可自动处理”答案时的可信度;RadLE-S(Safety Index)则聚焦高置信错误带来的安全风险。作者特别强调,在医疗场景里高置信但错误的回答往往比普通错误更危险。

测试结果与结论

基准测试得出的主结论是:不存在单一“最佳”的医疗诊断模型。Claude Fable 5 拿下了主评分,并在安全性与可靠性指标上领先,其可靠性在 RadLE-R 上几乎贴近人类专家基线。与此同时,Gemini 3.1 Pro 在原始准确率上领先。此外,在安全性指标上,OctoMed 7B 与 Meta 的模型也榜上有名。作者据此指出,模型准确率的持续提升并不自动意味着可信度的同步提升,“答对更多”与“更适合自主部署”并不是一回事。

行业价值

这组结果把医疗 AI 评测重点从“做对多少”推进到“何时该停手”。对于希望把模型用于半自动或自主诊断流程的团队,这类基准能更早暴露过度自信和不当自动化的风险,提醒行业在看排行榜时不能只盯准确率。

2026-07-13 ~ 2026-07-14 · 8 条相关

一手来源

另有 2 条近重复转述:DrDatta_AIIMS · shuyanzh36