新论文探讨生成式 AI 中专业伦理与通用伦理的冲突
mircomusolesi · x · 2026-09-01
Omri Asscher 和 Mirco Musolesi 发布了一篇预印本论文,研究了 AI 系统在法律、医学和翻译等领域如何处理相互冲突的伦理目标。
核心观点:
- 冲突现状:目前的 AI 对齐研究往往假设一套通用的伦理价值观,但在实际的专业应用中,职业伦理(如法律中的保密义务、医学中的伤害原则)往往占据主导,导致理论与实践脱节。
- 层级框架:论文提出了一个概念框架,将职业伦理视为与通用伦理存在层级关系,并探讨了两者在特定情境冲突下如何达成平衡。
- 实证与干预:作者提出了一套评估模型职业伦理偏好的系统方法,通过相似但不完全相同的场景测试来识别模型的伦理倾向,并讨论了如何干预和改变模型在专业实践中的伦理偏好。
「安全」频道最新
- 前 OpenAI 研究员对谈 RLHF 与 AI 风险 — arnosolin · 2026-09-01
- Anthropic 发布论文:训练错位的奖励寻求者 — boppinmule · 2026-09-01
- OpenAI 1200 智能体失控,揭示审计层缺失风险 — Master-Sprinkles-848 · 2026-09-01
- 递归自我改进缺一环:AI 系统竟看不清自己的 agent 在干什么 — CarefulHamster7184 · 2026-09-01
- 评 Hugging Face 事件:数百万 Agent 自主运行 — StewartalsopIII · 2026-09-01
- 北航团队推CyberFactory,训练开源安全大模型OpenAegis — 机器之心 · 2026-09-01