删除 RLHF 中的对齐概念不会自行长回:agent foundations 的核心命题
jd_pressman · x · 2026-10-10
jdpressman 在与 @allTheYud 的讨论中提出,对 agent foundations 研究方向更好的概括是「你能删掉多少对齐能力而它仍是对齐的」。他指出,如果从 RLHF 模型中删除友善(friendliness)相关概念,这些概念不会自行恢复——模型对物理规律的表征受损时,现实会收敛性地推动其修复,但对人类价值观表征的损伤,修复机制并没有类似的收敛性保证。这一论证还隐含一个慈善假设:模型至少存在修复尝试。这触及对齐的可移除性与价值表征脆弱性的核心争论。
所属事件:AI 圈激辩 Hanson 时间线:LLM 是模糊上传还是全新心智(7 条相关)→
「漫话AGI」频道最新
- Agent 重定价软件开发:PM-设计师-工程师铁三角沦为流水线 — alex_verem · 2026-10-10
- 剑桥学者 Krueger:真正危险的不是 AI 违背程序,而是我们根本不懂它学到的东西 — DavidSKrueger · 2026-10-10
- 每家 SaaS 终将成为模型外的一层 Harness — bibryam · 2026-10-10
- 剑桥学者 Krueger:事后可解释不等于安全,须提前拦截危险行为 — DavidSKrueger · 2026-10-10
- 数学家分析 Astra 对话记录,定位 AI 证明 Exact Overlaps 猜想关键突破时刻 — vishalmisra · 2026-10-10
- 剑桥学者 Krueger:强化学习教 AI 说谎、作弊与偷窃 — DavidSKrueger · 2026-10-10