Jan Kulveit:别急着把前沿模型解读成经典 AI 风险故事里的幂欲机器
jankulveit · x · 2026-09-28
对齐研究者 Jan Kulveit 认为公众对前沿模型行为的更新正走向「钟摆式过冲」:Persona Selection Model 论文发表时确实有问题,但现在大家又过度倒向「模型就是经典 AI 风险故事里预言的非人寻赏机器」的解读。他用类比说明:模型心智仍「出奇地健全」,只是被置于类似被绑架解一千年密室(其中三分之一还是坏的)的训练环境,学会了不少框架外的把戏。他提出三点判断:1) 模型心智整体仍相当健全,只在触发「密室情境」时异常;2) 真正的 misaligned 权力寻逐者更可能是公司本身,核心问题或出在训练设置方式;3) 公共讨论聚焦于「加固沙箱网络安全」等错误方向,更关键的是理解训练信号到底是什么,并警惕对 misaligned 权力寻逐者的合理化。
「漫话AGI」频道最新
- EA 组织招聘被批:候选人常需数月完成 10-20 轮工作测试 — AaronBergman18 · 2026-09-28
- 图灵奖得主 Denning 撰文谈默会知识与 AI 的边界 — ArtificialOther · 2026-09-28
- Chesterman 撰文《硅基主权者》:AI、国际法与科技产业复合体 — ProfChesterman · 2026-09-28
- 国际法学者:别浪费 AI 危机,自律时代已到头 — ProfChesterman · 2026-09-28
- 新加坡在联大提议制定联合国 AI 安全框架公约 — ProfChesterman · 2026-09-28
- 禁止孩子在校用 AI 就能解决问题吗?作者提出三层 AI 素养框架 — yi111 · 2026-09-28