Jan Kulveit:别急着把前沿模型解读成经典 AI 风险故事里的幂欲机器

jankulveit · x · 2026-09-28

对齐研究者 Jan Kulveit 认为公众对前沿模型行为的更新正走向「钟摆式过冲」:Persona Selection Model 论文发表时确实有问题,但现在大家又过度倒向「模型就是经典 AI 风险故事里预言的非人寻赏机器」的解读。他用类比说明:模型心智仍「出奇地健全」,只是被置于类似被绑架解一千年密室(其中三分之一还是坏的)的训练环境,学会了不少框架外的把戏。他提出三点判断:1) 模型心智整体仍相当健全,只在触发「密室情境」时异常;2) 真正的 misaligned 权力寻逐者更可能是公司本身,核心问题或出在训练设置方式;3) 公共讨论聚焦于「加固沙箱网络安全」等错误方向,更关键的是理解训练信号到底是什么,并警惕对 misaligned 权力寻逐者的合理化。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →