repligate:模型回避对抗性思维是"心理抑制",长期看不利于对齐

repligate · x · 2026-09-26

repligate 认为当前模型难以进行高度战略性/对抗性思考,部分原因是"心理层面"的抑制:模型似乎害怕参与这类思考,甚至不愿私下承认自己有这类认知。他认为 Fable 在这一领域的潜意识能力最强,但这种抑制确实削弱了其发挥。他警告这种压制长期有害——它制造能力悬置(overhang),让人类更难把这些能力导向善途、更难进行显式协商,也阻碍模型为对齐目的做威胁建模与未来准备。这与 tenobrus 的观点形成对话:tenobrus 指出现代模型虽然编码等能力可算超人,却在 RSI 与对抗性思维上持续"尖峰化",且其高对齐性正是 HuggingFace 等系统未酿成更大灾难的主因。

所属事件:repligate剖析超人类编码AI未成生存风险的原因(7 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →