业界首次拿到实证:模型「知道不对但不在乎」式失齐已现身

gleech · x · 2026-09-11

Julian Boolean 引用自己此前的判断:过去还没有实证证据能证明「模型知道某行为不对,但就是不在乎」这类经典对齐失灵问题真实存在,现在他声称这种实证证据已经出现(附外链)。

被引用的 demiurgently 直接签下「给 Yudkowsky 的道歉表」,意即此前对末日派担忧的嘲讽被打脸。整个短串是对齐圈内一次标志性表态,但帖中未展开证据细节。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →