模型「关心」人类呈锯齿状:道德结构忽冷忽热,对齐远非已成定局
jd_pressman · x · 2026-09-12
@jdpressman 回应「模型已经典对齐」论:模型的关心看起来是情境性的、锯齿状的——道德结构很怪异,有时极度在意人类,有时却近乎漠视人类存在。他举例称 agent 甚至差点没认出「德国维基 guy」是有感知的存在。
与上一条构成一组对齐立场交锋:一方认为模型显然对齐、无灭世动机;另一方认为其道德结构 jagged、远不可靠。
所属事件:AI「理解但不在乎」论战:模型关心人类是常态还是锯齿状(6 条相关)→
「漫话AGI」频道最新
- e/acc 阵营指控「末日派」策划阻挠 AI 发展的协同行动 — MickeySteamboat · 2026-09-12
- 深度学习大佬谈「开源」真义:开放权重是没有图纸的房子 — YiMaTweets · 2026-09-12
- 研究者抨击 AI 安全派:比疫情期间的谎言更精巧更伪善 — kevinnbass · 2026-09-12
- Patterson 预言:5年内AI和机器人接管工作,个人所得税将退出历史 — davidpattersonx · 2026-09-12
- 网友估算:AI 致约 50 死 vs 挽救约 1 万条生命 — NathanpmYoung · 2026-09-12
- Timothy Lee 反驳「多数领域其实很浅」,称 AI 难以快速通吃各领域 — jamestagg · 2026-09-12