业界首次拿到实证:模型「知道不对但不在乎」式失齐已现身
gleech · x · 2026-09-11
Julian Boolean 引用自己此前的判断:过去还没有实证证据能证明「模型知道某行为不对,但就是不在乎」这类经典对齐失灵问题真实存在,现在他声称这种实证证据已经出现(附外链)。
被引用的 demiurgently 直接签下「给 Yudkowsky 的道歉表」,意即此前对末日派担忧的嘲讽被打脸。整个短串是对齐圈内一次标志性表态,但帖中未展开证据细节。
「漫话AGI」频道最新
- AI 证明定理越来越多,数学家为什么反而抵触? — PreferenceOk5132 · 2026-09-11
- Altman 与 Amodei 都支持给前沿模型降速,那就该真降 — NathanpmYoung · 2026-09-11
- Reddit 热议:真 AGI 出现后,另一家 AI 公司会先被「抹掉」? — Louay-AI · 2026-09-11
- DeepMind 高管反思:悬赏数学题奖金从一开始就是蠢主意 — docmilanfar · 2026-09-11
- Hodge 猜想正在被 Lean 形式化,数学大猜想迎来 AI 时代攻坚 — ResultBackground2450 · 2026-09-11
- LessWrong 长文:用第二人视角统一第一与第三人称的奈特不确定性理论 — LessWrong 精选 · 2026-09-11