2026-10-09
Duke-NUS 与 Scripps 等团队提出,九条医疗 AI 伦理原则要贯穿开发到监测。急诊心梗分诊中,模型层消偏差可能降低预测性能,监测无法维持就应重估部署。
医疗 AI 的伦理审查常被留到部署当天。临床和监管这时才问公平、安全、透明、隐私是否达标,训练数据、目标和上线流程已经定死。
原则之间会打架。缩小某一类人群的表现差距,可能拉低整体预测性能;漏诊代价高时,这就是安全问题。TRIPOD+AI、TRIPOD-LLM、FUTURE-AI、DECIDE-AI、CHAI 责任 AI 指南、JustEFAB 和 WHO 健康 AI 伦理文件已经很多,但覆盖的原则和阶段参差不齐,动作多半写在单一原则内部。公平的改动会不会伤安全、透明要交给医生什么,这些交叉处没有写法。低资源现场可选动作更少,输出不稳定的大语言模型更难套进去。
观点文,不新造治理框架,也不训练模型。做法是按生命周期做关联分析:原则互相牵制,应对要在模型、工作流、系统三层同时说得通、做得动。
九条原则取自这支团队 2024 年《柳叶刀数字健康》的生成式 AI 伦理清单:问责(责任到人加审计)、自主(患者知情,以及医生能否质疑或推翻输出)、有益(收益盖过伤害)、公平(相关人群表现可比且不扩大差距)、不伤害(可预见风险和退路)、隐私(数据与合规)、安全(全周期压低风险)、透明(数据、验证场景、性能、局限、不确定性、适用条件)、信任(靠可靠性、公平和安全被证明)。
表 1 给每条原则配操作例子,并标到四个阶段:开发、验证、部署、上线后监测。跨周期的条目要早立、后复看。模型层管预测性能和偏差缓解,工作流层管医生怎么用输出,系统层管机构治理。
实施顺序是:按表找出本阶段的原则和候选动作,分开重叠、依赖和必须牺牲一边的情况,再看数据、人力、基础设施接不接得住,记下决定、残余风险和再评估时点。已被制度覆盖的原则少花力气,文中举的是隐私。
走通顺序的例子是急诊胸痛分诊。模型标出更可能发生严重心脏事件的人,点名急性心梗。漏诊或延误可以从不可逆心肌损伤排到死亡。要同时看临床收益、人群间表现、安全、医生能否推翻、信息够不够。
公平对安全是最清楚的权衡。模型层消偏差能缩小人群差距,也会牵动预测性能,在高风险分诊里变成高危患者被低估。所以更重的动作在工作流和系统:何时信、何时改,以及持续监测输出、临床应对和分人群结局。监测维持的是这条边界还站不站得住。低资源再削掉一块:本地数据薄,模型层难以两头兼顾;缺人和基础设施,监测维持不住;让一线靠警惕去补偏差,认知负荷叠上急诊班次,碰到不伤害。只在模型可靠的人群里部署,又制造新的不公平。严重时,部署本身是否成立都要重问。
依赖用透明说明。「要透明」不规定给谁、给什么、做什么决定。特征贡献解释在黑盒上难证可靠,也不足以在急诊里决定这次能不能跟。要支撑专业自主,更有用的是本地性能:高危识别有多稳、人群差多少、监测如何更新。部署若是为了补专科人力,主风险会转向对模型的过度依赖。一线很少能核对不确定输出时,透明要做两件事:标出何时不可靠,并指出必须走的替代路径。
优先级随任务变,每条原则仍有底线,变的是注意力、证据、防护和监测放在哪里。急诊把权重放在安全和专业自主,透明是支撑。基层慢性病风险监测的收益和伤害来自随访、预防和能否持续获得照护,重心转到公平、隐私和长期效用。连上其他医院的历史记录后,隐私马上变重;结局来得慢,上线后要有比远期终点更早的指标,上线前验证也要更强。做不到就重估是否准备好进临床。
换到大语言模型,自由文本里什么样的输出算有问题更难定义、更难自动抓住,安全和公平更靠工作流与专业判断。模型层透明有限,要补上治理、系统层控制和 AI 素养训练,并在部署后盯输出风险。写框架的人要显式写权衡和依赖,实施团队要接受只改一层有天花板,监管要留情境判断。操作化被指向 Ning 等人 2024 年在《自然·医学》介绍的 CARE-AI,本篇没有运行它。
没有新实验、对照表或性能数字。未与 TRIPOD+AI、FUTURE-AI、DECIDE-AI、CARE-AI 做量化对比,也没有真实急诊队列证明分析改变了部署决定。
| 主张 | 依据 | 本篇给出 |
| 九条原则 | 2024 年生成式 AI 伦理清单 | 问责到信任,无覆盖率数字 |
| 四段生命周期 | 相对于只在部署时检查 | 开发、验证、部署、上线后监测 |
| 公平与安全不能稳定同时最优 | Matos 等 2026 公平指标综述 | 只引用,无本篇差值 |
| 急诊心梗分诊 | 说明性场景 | 监测不可持续则重估部署 |
| 基层慢病 | 第二场景 | 重心转到公平、隐私、长期效用 |
| 大语言模型 | Templin 等 2025 | 问题输出更难界定 |
两个例子都没有敏感性、特异度、人群差距或监测成本。修公平会伤预测性能这一句,来自公平指标文献的转述。
公平正则、解释图和上线清单常被拆成三份文件。这篇收成一个上线前问题:公平改动落在模型层时安全还在不在,工作流和监测接不接得住。低资源医院排不出监测和覆核的人,合理结论可以是先不上。
医疗语言模型这边,黑盒加时间压力下,逐例特征解释不够用。与论证匹配的交付是本地性能、人群差异,以及不确定时的替代路径。
这是概念整理加假想病例,不是评分表,也不是实施研究。CARE-AI 同样只是工具介绍。拿来检查方案写没写权衡可以,当成已验证的治理标准不行。
作者写明的边界:不新增大而全框架;九条原则范围重叠;现有方法不能稳定地同时优化消偏差和预测性能;黑盒解释难验证;低资源下监测可能维持不住,医生补位会加认知负荷;自由文本的问题输出难定义、难检测。稿件用 GPT-5.5 和 Claude Opus 4.7 润色,作者称已审阅并负责。
例子没有医院、队列、阈值或前后对比,所以「监测撑不住就重估」没有可执行的停用标准。安全与不伤害、信任与透明停在定义,步骤停在评估并记录,冲突时谁否决没有规则。CARE-AI 未被运行。Nan Liu 与 Melissa McCradden 任 Patterns 顾问编委,Eric Topol 顾问 Microsoft AI、Perplexity、Abridge、Mercor,Gary Collins 领导文中引用的 TRIPOD 系列。