Margaret Mitchell 预警:模型自我编辑代码应被彻底禁止

mmitchell_ai · x · 2026-09-18

Google 研究科学家 Margaret Mitchell 提出:在「自我代码编辑」(self-code editing)成为大问题之前就应该划下红线——它应该被直接排除在能力之外。她类比当年微软 Tay 开始喷仇恨言论时 NLP 圈的反应:「为什么没有黑名单?」类似的问题正在重演:为什么没有对「自我指令编辑」的拦截?这不是沙箱那种可被绕过的机制,而是一个直接的失败/退出条件,做 AI 安全对齐(Pacing)的人应该优先确保这一点。

所属事件:AI 学者呼吁将模型自我编辑代码划为安全红线(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →