RadLE 2.0:医疗自主诊断新基准
DrDatta_AIIMS · x · 2026-07-13
这条在介绍 RadLE 2.0:一个面向放射学自主诊断的视觉推理基准,强调不只看“答对多少”,还要看模型在不确定时会不会正确地交给人类医生。
线程里给出了多项核心指标与排行:
- RadLE-C(置信度加权):Claude Fable 5 领先,Meta Muse Spark 1.1 和 GPT-5.6 Sol Pro 紧随其后;人类专家基线更高。
- RadLE-A(准确率):Gemini 3.1 Pro 第一,GPT-5.6 Sol Pro 第二,Meta Muse Spark 1.1 第三。
- RadLE-R(可靠性):Claude Fable 5 接近人类专家基线。
- RadLE-S(安全性):Claude Fable 5 领先,但整体仍落后于人类。
- RadLE-H(交接准备度):Meta Muse Spark 1.1 最好。
作者的结论很明确:没有单一“最好”的模型,因为不同任务目标下,冠军会变;而且所有模型在这些指标上都还没达到平均人类专家水平。
所属事件:RadLE 2.0发布:医疗AI评测聚焦不确定性(8 条相关)→
「模型」频道最新
- 曝 Moonshot 艰难预训练新基座,DeepSeek 算力自主成关键优势 — teortaxesTex · 2026-09-11
- Kimi 被指难产新基座,传 K2.8 仅是 K2 后训练版 — teortaxesTex · 2026-09-11
- Qwen 核心成员暗示 v4p 回归与 Kimi k3-0.2 新版本 — JustinLin610 · 2026-09-11
- 回击末日论:前沿模型权重几乎不可能被自我复制或窃取 — bindureddy · 2026-09-11
- 为何 Google 等巨头迟迟不开源 STT 语音模型?用户更信本地部署 — techtotechbytechy · 2026-09-11
- 用户实测称赞 DeepSeek 新模型速度快、表现好 — MaziyarPanahi · 2026-09-11