AI该顺从还是替你做主?EACL论文揭示大模型对齐设计隐忧

xuanalogue · x · 2026-07-30

被转发的原推介绍了一篇被 EACL 2026 接收的论文《From Delegates to Trustees》。论文探讨了 AI 代理在代表人类利益时面临的核心设计权衡:是应该像“代表”一样完全镜像用户的表面偏好,还是像“受托人”一样基于长期利益替用户做判断。

研究者在美国政策投票的模拟实验中发现,采用偏向长期利益的“受托人”模式,在共识明确的问题上能做出更符合专家意见的决策;但在缺乏共识的议题上,模型会暴露出更多自身默认立场的偏见。这揭示了在保留用户自主权和做出最优决策之间存在根本性的对齐矛盾。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →