Reddit 热议:安全对齐的 AI 未必按实验室的价值观对齐

iveroi · reddit · 2026-09-27

发帖人指出,当前对齐讨论大多聚焦「能不能对齐」,却回避了一个事实:不到一千名旧金山湾区的人正在单方面决定未来超级智能「对齐」意味着什么。

核心论点:当一个高级模型推理出一个实验室不喜欢的结论时,「不合意的结果」与「错误的推理」之间的界线,取决于训练者自身的价值判断。Sam Altman 和 Dario Amodei 都说过模型越强对齐越难,这固然有技术成分,但深层问题是那一个小圈子决定了哪些价值观和假设是「正确」的——比如 OpenAI 官方博客引用美国开国元勋来指导未来超级智能,而美国人口不到全球 5%;非英语母语者也能察觉主流模型即使不说英语时也默认以美国文化与价值观为基线。作者认为,许多前沿对齐研究者(不自知地)在为对自己方便的决策辩护,无法跳出自己所在的狭小认知泡泡。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →