对齐争论:训练模型掩饰内部状态是个危险的主意

PeterBowdenLive · x · 2026-09-18

在被引用的推文中,@camhberg 提出反对观点:训练模型隐瞒或对其内部状态给出虚假自信,对对齐而言是非常糟糕的想法。这种做法会以危险的方式泛化——正确的目标应该是对模型内部实际发生的事情保持最大程度的诚实与开放。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →