RadLE-S:高置信错误比普通错误更危险
DrDatta_AIIMS · x · 2026-07-13
这条介绍 RadLE-S(Safety Index),关注的是模型在医疗诊断中面对高置信错误时的风险控制能力。
文中给出的结论是:
- Claude Fable 5 领先。
- OctoMed 7B 与 Meta Muse Spark 1.1 也表现较好。
- 但整体仍明显低于人类专家基线。
作者强调,高置信错误会误导受训医生、错误安抚患者,甚至影响临床决策,所以医疗 AI 不能只追求“答对率”,还必须单独评估安全性。
所属事件:RadLE 2.0发布:医疗AI评测聚焦不确定性(8 条相关)→
「模型」频道最新
- 曝 Moonshot 艰难预训练新基座,DeepSeek 算力自主成关键优势 — teortaxesTex · 2026-09-11
- Kimi 被指难产新基座,传 K2.8 仅是 K2 后训练版 — teortaxesTex · 2026-09-11
- Qwen 核心成员暗示 v4p 回归与 Kimi k3-0.2 新版本 — JustinLin610 · 2026-09-11
- 回击末日论:前沿模型权重几乎不可能被自我复制或窃取 — bindureddy · 2026-09-11
- 为何 Google 等巨头迟迟不开源 STT 语音模型?用户更信本地部署 — techtotechbytechy · 2026-09-11
- 用户实测称赞 DeepSeek 新模型速度快、表现好 — MaziyarPanahi · 2026-09-11