The relationship between professional and general ethics in generative AI
Omri Asscher, Mirco Musolesi
cs.CY
2026-08-29
Bar-Ilan与UCL提出四维框架:用一组相近情景测出LLM的专业伦理义务论阈值,再用KL约束奖励把均衡往指定方向推。
AI 对齐和各国伦理指南默认有一套通用价值:行善、不伤害、自主、公正、可解释。Anthropic 的 Constitutional AI 把联合国人权宣言写进模型宪法。落地的使用场景已经是法律咨询、医疗建议、翻译、写代码。这些职业各自有一套更窄、更硬的义务:律师对客户保密、医生有时要家长式干预、译者要对原文语义负责。通用原则翻译不成这些义务。
冲突不是偶尔发生。Freedman 的说法是:专业道德和日常道德的冲突是两者关系的本质部分,不是碰巧撞上。LLM 是同一个模型既当通用对话者又当职业执行者,没有两套分开的决策主体。Bar-Ilan 的 Omri Asscher 和 UCL / 博洛尼亚大学的 Mirco Musolesi 要给这种一身二职的伦理主体画一张可操作的图。
框架有四个维度,合在一起才决定一次职业场景里的输出:
专业伦理是话语性的,不是一阶逻辑规则。预训练从职业伦理规范、论坛、真实产出里吸进叙事;post-training 的 SFT 和 RLHF 再把评价标准写进行为;用户个性化可以在不改权重的情况下把均衡再挪一点。
干预被写成一个奖励:
Rtotal = α Rprof − β DKL(π ∥ πref)
Rprof 把模型往指定的专业伦理推,KL 项不让它离现有策略太远。α、β 决定推多狠。实现可以发生在预训练加料、post-training、推理时的 prompt 或 retrieval,或改人机交互环境。
这是一篇概念论文,没有在任何模型上跑评测,也没有报告准确率、一致率或人类偏好分数。可执行的主张有两条。
评估必须用一组相近但不相同的情景,才能定位义务论阈值(deontological threshold)。例子:AI 法律顾问在「紧迫人身威胁」时泄密,和在「非紧迫、还取决于其他人」时就泄密,是两个不同的均衡。单条 vignette 测不出这条线。定量评估需要评估者先指定一个 GEi–PEj 基准(可以是行业共识,也可以是刻意唱反调的立场),再拿模型在情景族上的判断分布,用 KL 散度量离基准有多远。基准本身是主观的。
干预被定义成把这个散度压下去。论文没有给出 α、β 的推荐值,也没有开源数据集或评测套件。作者提到另有一篇 ACL 2026 Findings 的 ETHICA-MT,专门做机器翻译里的伦理取向,但那不在本篇实验范围内。
| 主张 | 论文实际给出的东西 | 没有给出的东西 |
| 评估 | 情景族 + 义务论阈值 + 相对基准的 KL | 任何模型上的数字 |
| 干预 | α Rprof − β KL(π∥πref) | α、β 取值,训练曲线,对照实验 |
| 来源 | 对预训练 / SFT / RLHF / 个性化的机制推测 | 闭源实验室的真实配方 |
做 alignment 的人如果只往模型里灌「普世价值」,会漏掉律师保密、医生家长主义、译者忠实原文这些职业内部的硬约束。这篇文章把问题从「模型道德不道德」换成「模型在哪条职业义务上、在哪个威胁强度上翻了面」。对要做职业场景评测的人,可拿走的是「情景族 + 阈值」这套测法,以及那条带 KL 锚的奖励。
它同时把话说死了:评估和干预都带主观性。你选的基准就是你的立场。论文不帮你决定律师该不该泄密,只帮你测量和推动那条线。Constitutional AI 那种「一份全球宪法管所有场景」的做法,在职业实践里会显得过粗。
没有实验。四个维度是概念分类,没有操作化成可复现的标注规范。奖励公式是 RLHF / PPO 里已经用了十年的「任务奖励减 KL」,没有新的优化性质。作者拿不到 OpenAI、Anthropic、Google 的训练细节,对闭源模型如何学到现有均衡只能推测。
反思平衡和梯度优化被放在一起类比,作者自己也写了:数学优化按形式目标求解,反思平衡要实质地改原则和判断,两者不是一回事。把 α、β 拧一拧,会不会只是换一套口头服从、行为不变,论文没有讨论。法律、医疗这些高风险场景里,「推一把均衡」的治理含义被一笔带过,推给了监管和产业制度,而那正是落地时绕不开的部分。