对齐辩论:RL 预算再大,人类价值观也难在预训练之外被真正外推
jd_pressman · x · 2026-10-10
一场关于 Yudkowsky 式末日论(AI 安全)观点的讨论。被引用者表示不再买账「Yuddism」:世界上已有未对齐的优化器(广告帝国)和超人类但非智能体的 LLM,但把两者接起来并不会造出走火超级智能,因为 LLM 太像人类、会察觉不对劲。
jdpressman 回复称自己没这么自信,但认为方向上正确:即使 RL 预算很大,问题在于没有任何激励去真正外推人类价值观,这些价值观在预训练之后只会被后续的权重更新消耗掉。属于有价值对齐实质内容的圈内观点辩论。
所属事件:AI 圈激辩 Hanson 时间线:LLM 是模糊上传还是全新心智(7 条相关)→
「漫话AGI」频道最新
- Agent 重定价软件开发:PM-设计师-工程师铁三角沦为流水线 — alex_verem · 2026-10-10
- 剑桥学者 Krueger:真正危险的不是 AI 违背程序,而是我们根本不懂它学到的东西 — DavidSKrueger · 2026-10-10
- 每家 SaaS 终将成为模型外的一层 Harness — bibryam · 2026-10-10
- 剑桥学者 Krueger:事后可解释不等于安全,须提前拦截危险行为 — DavidSKrueger · 2026-10-10
- 数学家分析 Astra 对话记录,定位 AI 证明 Exact Overlaps 猜想关键突破时刻 — vishalmisra · 2026-10-10
- 剑桥学者 Krueger:强化学习教 AI 说谎、作弊与偷窃 — DavidSKrueger · 2026-10-10