RadLE 2.0:医疗自主诊断基准发布
DrDatta_AIIMS · x · 2026-07-13
这是 RadLE 2.0 的主帖:一个面向放射学自主诊断的视觉推理基准,目标不是只测“模型能答对多少”,而是评估模型在医疗场景里是否知道何时该停、何时该交给人类医生。
作者发布了五个核心指标:
- Confidence Weighted:正确且自信加分,错误且自信扣分。
- Reliability:模型在给出自主级回答时是否真的可靠。
- Accuracy:传统准确率。
- Safety:对高置信错误的惩罚。
- Handover Readiness:模型在不确定时是否会交接给专家。
线程里还提到,他们把 OpenAI、Anthropic、Meta、Google DeepMind、xAI、NVIDIA、阿里 Qwen、Mistral、MiniMax 等家的前沿/开源/医疗 VLM 都放进了排行榜,但没有任何模型达到平均人类专家基线。
所属事件:RadLE 2.0发布:医疗AI评测聚焦不确定性(8 条相关)→
「模型」频道最新
- 曝 Moonshot 艰难预训练新基座,DeepSeek 算力自主成关键优势 — teortaxesTex · 2026-09-11
- Kimi 被指难产新基座,传 K2.8 仅是 K2 后训练版 — teortaxesTex · 2026-09-11
- Qwen 核心成员暗示 v4p 回归与 Kimi k3-0.2 新版本 — JustinLin610 · 2026-09-11
- 回击末日论:前沿模型权重几乎不可能被自我复制或窃取 — bindureddy · 2026-09-11
- 为何 Google 等巨头迟迟不开源 STT 语音模型?用户更信本地部署 — techtotechbytechy · 2026-09-11
- 用户实测称赞 DeepSeek 新模型速度快、表现好 — MaziyarPanahi · 2026-09-11