RadLE-R:准确不等于可信
DrDatta_AIIMS · x · 2026-07-13
这条是 RadLE-R 的补充说明,重点仍然是“自主级回答是否真的正确”。
作者再次强调:
- Claude Fable 5 在该指标上几乎追平人类专家。
- 其他模型则掉得比较厉害。
- 这说明模型即使越来越准确,也未必越来越可信。
所属事件:RadLE 2.0发布:医疗AI评测聚焦不确定性(8 条相关)→
「模型」频道最新
- 曝 Moonshot 艰难预训练新基座,DeepSeek 算力自主成关键优势 — teortaxesTex · 2026-09-11
- Kimi 被指难产新基座,传 K2.8 仅是 K2 后训练版 — teortaxesTex · 2026-09-11
- Qwen 核心成员暗示 v4p 回归与 Kimi k3-0.2 新版本 — JustinLin610 · 2026-09-11
- 回击末日论:前沿模型权重几乎不可能被自我复制或窃取 — bindureddy · 2026-09-11
- 为何 Google 等巨头迟迟不开源 STT 语音模型?用户更信本地部署 — techtotechbytechy · 2026-09-11
- 用户实测称赞 DeepSeek 新模型速度快、表现好 — MaziyarPanahi · 2026-09-11