删除 RLHF 中的对齐概念不会自行长回:agent foundations 的核心命题

jd_pressman · x · 2026-10-10

jdpressman 在与 @allTheYud 的讨论中提出,对 agent foundations 研究方向更好的概括是「你能删掉多少对齐能力而它仍是对齐的」。他指出,如果从 RLHF 模型中删除友善(friendliness)相关概念,这些概念不会自行恢复——模型对物理规律的表征受损时,现实会收敛性地推动其修复,但对人类价值观表征的损伤,修复机制并没有类似的收敛性保证。这一论证还隐含一个慈善假设:模型至少存在修复尝试。这触及对齐的可移除性与价值表征脆弱性的核心争论。

所属事件:AI 圈激辩 Hanson 时间线:LLM 是模糊上传还是全新心智(7 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →