2026-08-04
623 名普通人和 153 名医生参与实验:公平训练的 AI 诊断模型同时提升了准确率和肤色公平性,但 LLM 解释放大普通人的自动化偏见(AI 对涨 13%、错跌 21%),医生则对错都不受影响。
AI 进了医疗,但模型是个黑盒,医生和患者凭什么信它的判断?可解释 AI(XAI)就是来填这个缺口的:GradCAM 用热力图标出图像里模型盯着看的区域,CBIR 给你几张最像的历史病例,多模态大模型则直接生成一段文字解释。思路是,把决策依据亮出来,人就能决定该不该听。
但前人发现一件矛盾的事:解释反而让人更依赖 AI,并不让人更审慎。这篇要回答的是更细的问题:当解释来自现在最火的多模态大模型时,它对专家和外行的影响一样吗?答案是,不一样,而且差得很远。
团队做了两个大规模在线实验。研究一招募 623 名普通人,做黑色素瘤与痣的二元分类(较易);研究二招募 153 名全科医生(PCP),做开放式鉴别诊断(较难),另外补了 320 名医学生做中间对照。每人看 12 张临床图,按肤色(Fitzpatrick 1–6 级)和病种平衡。
模型本身是公平约束训练的皮肤病诊断网络,用的是 CDANN(条件域对抗网络)让输出在肤色上均衡。模型在研究一里固定 83.3% 准确率(10 对 2 错),研究二里约 79.2%。
交叉对比两种变量。第一种是解释方式:basic(只给诊断)、CBIR、GradCAM、多模态 LLM 文字解释。第二种是决策顺序:Human-First(人先判断再看 AI)还是 AI-First(先看 AI 再判断)。测的是准确率、置信度与准确率的校准,以及肤色差距。
公平模型本身立住了:研究一里普通人准确率从 69.7% 升到 75.8%,肤色差距(平衡准确率)缩小了 76.9%;研究二里全科医生 top-1 从 11.5% 升到 33%(涨 21.5 个百分点),top-3 涨 43.5 个百分点。
关键的分歧在「AI 看错时」:
| 人群 | AI 看对时 | AI 看错时 |
| 普通人(LLM 解释) | +13.4% | −21.1% |
| 全科医生(任意解释) | 稳定受益 | 几乎不动(β=0–0.021) |
对普通人,LLM 解释是四类里涨幅最大的,但看错时跌幅也最大(−21.1%,basic 才 −14.6%)。这就是自动化偏见:模型说啥人就信啥,连错了也照跟。全科医生正相反,AI 对时照用,AI 错时基本不受影响,靠自己的专业判断扛住。医学生的表现夹在两者之间,越资深越「抗错」。
还有个顺序效应:把 AI 摆在人前面(AI-First)会放大盲从,全科医生里 LLM 解释让「盲从型」比例涨了 19 个百分点。
对做医疗 AI 和人机协同产品的人,这篇给了三条很实操的提醒。第一,LLM 解释不是万能良药,甚至对非专家有害,一段自信的文字解释在外行眼里约等于正确答案。第二,产品流程别把 AI 诊断摆在用户决策之前,锚定效应会放大盲从,Human-First 是更稳的顺序。第三,公平约束训练(CDANN)确实有效,而且它的肤色公平收益能穿透到「人+AI」的最终决策里,不只是一张漂亮的模型榜单。
同一个 AI 系统,配什么人、解释怎么给、顺序怎么排,决定了它是帮忙还是帮倒忙。
作者自己列了几条:生态效度有限(没有年龄、病史等真实就诊上下文,任务被简化,每人只看 12 张图,在线而非临床);LLM 解释只生成一次、没有筛选或优化,提示词偏自信语气是个混淆因素;结论只针对他们这套模型和 XAI 实现。
更值得追问的是:模型准确率被人为固定在 83.3%,真实系统的准确率是浮动的,自动化偏见的强弱可能高度依赖模型自身校准,模型越自信越容易把人带偏,而这篇没有充分拆解这层。12 张图的样本量对个体层面的盲从模式分析也偏小。另外公平增益主要来自模型设计而非 XAI,所以对普通人来说,LLM 解释的净价值其实相当可疑:它放大了模型的正确,也等量放大了模型的错误。