对齐辩论:RL 预算再大,人类价值观也难在预训练之外被真正外推

jd_pressman · x · 2026-10-10

一场关于 Yudkowsky 式末日论(AI 安全)观点的讨论。被引用者表示不再买账「Yuddism」:世界上已有未对齐的优化器(广告帝国)和超人类但非智能体的 LLM,但把两者接起来并不会造出走火超级智能,因为 LLM 太像人类、会察觉不对劲。

jdpressman 回复称自己没这么自信,但认为方向上正确:即使 RL 预算很大,问题在于没有任何激励去真正外推人类价值观,这些价值观在预训练之后只会被后续的权重更新消耗掉。属于有价值对齐实质内容的圈内观点辩论。

所属事件:AI 圈激辩 Hanson 时间线:LLM 是模糊上传还是全新心智(7 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →