医疗诊断基准RadLE 2.0发布
shuyanzh36 · x · 2026-07-14
这条内容围绕 Radiology’s Last Exam 2.0(RadLE 2.0) 展开,这是一个面向自主 AI 诊断的、带不确定性意识的放射学视觉推理基准。
帖子强调几个重点:
- 这是“首批”用于自治医疗诊断的视觉推理基准之一
- 评价重点不只是准确率,还包括模型知道何时停下并交给人类的能力
- 文中给出了多家前沿模型/医疗 VLM 的排行榜
转发里提到,Muse Spark 1.1 在 RadLE 上超过了 GPT-5.6 Sol 和 Gemini 3.1,但仍然没有超过 Fable,也明确表示人类医生目前依然更强。整体论点是:在把 AI 交给更高自治权之前,“会不会自知该停”比单纯分数更重要。
所属事件:RadLE 2.0发布:医疗AI评测聚焦不确定性(8 条相关)→
「研究」频道最新
- 用水池当计算机:六执行器波干涉实现机器人避障,准确率可达 100% — bravo_abad · 2026-09-11
- Marigold V2 发布:单步扩散 Transformer 刷新单目深度估计 SOTA — AntonObukhov1 · 2026-09-11
- AI智能体如何把经验变成持久进化?一份RSI递归自我改进指南 — Roger_M_Taylor · 2026-09-11
- Gans 年度复盘:ChatGPT 5.2 Pro 19分钟生成完整论文,但低质想法难上顶刊 — joshgans · 2026-09-11
- 四色定理迎来罕见新证明,数学家重审70年代计算机辅助证明 — soumitrashukla9 · 2026-09-11
- 数学家式路线图:线性代数+微积分+概率三大支柱学透机器学习 — TivadarDanka · 2026-09-11