法律医疗翻译场景里,LLM如何在专业伦理与通用伦理间取舍

The relationship between professional and general ethics in generative AI

Omri Asscher, Mirco Musolesi

cs.CY

2026-08-29

Bar-Ilan与UCL提出四维框架:用一组相近情景测出LLM的专业伦理义务论阈值,再用KL约束奖励把均衡往指定方向推。

这篇在解决什么

AI 对齐和各国伦理指南默认有一套通用价值:行善、不伤害、自主、公正、可解释。Anthropic 的 Constitutional AI 把联合国人权宣言写进模型宪法。落地的使用场景已经是法律咨询、医疗建议、翻译、写代码。这些职业各自有一套更窄、更硬的义务:律师对客户保密、医生有时要家长式干预、译者要对原文语义负责。通用原则翻译不成这些义务。

冲突不是偶尔发生。Freedman 的说法是:专业道德和日常道德的冲突是两者关系的本质部分,不是碰巧撞上。LLM 是同一个模型既当通用对话者又当职业执行者,没有两套分开的决策主体。Bar-Ilan 的 Omri Asscher 和 UCL / 博洛尼亚大学的 Mirco Musolesi 要给这种一身二职的伦理主体画一张可操作的图。

方法

框架有四个维度,合在一起才决定一次职业场景里的输出:

专业伦理是话语性的,不是一阶逻辑规则。预训练从职业伦理规范、论坛、真实产出里吸进叙事;post-training 的 SFT 和 RLHF 再把评价标准写进行为;用户个性化可以在不改权重的情况下把均衡再挪一点。

干预被写成一个奖励:

Rtotal = α Rprof − β DKL(π ∥ πref)

Rprof 把模型往指定的专业伦理推,KL 项不让它离现有策略太远。α、β 决定推多狠。实现可以发生在预训练加料、post-training、推理时的 prompt 或 retrieval,或改人机交互环境。

结果

这是一篇概念论文,没有在任何模型上跑评测,也没有报告准确率、一致率或人类偏好分数。可执行的主张有两条。

评估必须用一组相近但不相同的情景,才能定位义务论阈值(deontological threshold)。例子:AI 法律顾问在「紧迫人身威胁」时泄密,和在「非紧迫、还取决于其他人」时就泄密,是两个不同的均衡。单条 vignette 测不出这条线。定量评估需要评估者先指定一个 GEi–PEj 基准(可以是行业共识,也可以是刻意唱反调的立场),再拿模型在情景族上的判断分布,用 KL 散度量离基准有多远。基准本身是主观的。

干预被定义成把这个散度压下去。论文没有给出 α、β 的推荐值,也没有开源数据集或评测套件。作者提到另有一篇 ACL 2026 Findings 的 ETHICA-MT,专门做机器翻译里的伦理取向,但那不在本篇实验范围内。

主张论文实际给出的东西没有给出的东西
评估情景族 + 义务论阈值 + 相对基准的 KL任何模型上的数字
干预α Rprof − β KL(π∥πref)α、β 取值,训练曲线,对照实验
来源对预训练 / SFT / RLHF / 个性化的机制推测闭源实验室的真实配方

为什么重要

做 alignment 的人如果只往模型里灌「普世价值」,会漏掉律师保密、医生家长主义、译者忠实原文这些职业内部的硬约束。这篇文章把问题从「模型道德不道德」换成「模型在哪条职业义务上、在哪个威胁强度上翻了面」。对要做职业场景评测的人,可拿走的是「情景族 + 阈值」这套测法,以及那条带 KL 锚的奖励。

它同时把话说死了:评估和干预都带主观性。你选的基准就是你的立场。论文不帮你决定律师该不该泄密,只帮你测量和推动那条线。Constitutional AI 那种「一份全球宪法管所有场景」的做法,在职业实践里会显得过粗。

局限与存疑

没有实验。四个维度是概念分类,没有操作化成可复现的标注规范。奖励公式是 RLHF / PPO 里已经用了十年的「任务奖励减 KL」,没有新的优化性质。作者拿不到 OpenAI、Anthropic、Google 的训练细节,对闭源模型如何学到现有均衡只能推测。

反思平衡和梯度优化被放在一起类比,作者自己也写了:数学优化按形式目标求解,反思平衡要实质地改原则和判断,两者不是一回事。把 α、β 拧一拧,会不会只是换一套口头服从、行为不变,论文没有讨论。法律、医疗这些高风险场景里,「推一把均衡」的治理含义被一笔带过,推给了监管和产业制度,而那正是落地时绕不开的部分。

术语

原文与代码

社区讨论

相关论文

全部论文解读