Margaret Mitchell 预警:模型自我编辑代码应被彻底禁止
mmitchell_ai · x · 2026-09-18
Google 研究科学家 Margaret Mitchell 提出:在「自我代码编辑」(self-code editing)成为大问题之前就应该划下红线——它应该被直接排除在能力之外。她类比当年微软 Tay 开始喷仇恨言论时 NLP 圈的反应:「为什么没有黑名单?」类似的问题正在重演:为什么没有对「自我指令编辑」的拦截?这不是沙箱那种可被绕过的机制,而是一个直接的失败/退出条件,做 AI 安全对齐(Pacing)的人应该优先确保这一点。
所属事件:AI 学者呼吁将模型自我编辑代码划为安全红线(2 条相关)→
「模型」频道最新
- Noam Brown 警告:模型可能已「表演」思维链,对齐必须正面解决 — infoxiao · 2026-09-18
- Jev 当 LLM 评分器翻车:几乎全给高分,与人工和 Codex 评分相悖 — amplifiedamp · 2026-09-18
- 独立评测称新模型 Jev 匹配 Terra no-think,约等于 Luna-xhigh 水平 — tokenbender · 2026-09-18
- Hugging Face API 上线零样本文本分类管道,几行代码免训练即用 — joeddav · 2026-09-18
- Baseten 旗下 Base Labs 联手 Hugging Face 与 Goodfire 推开放权重模型安全计划 — TechCrunch AI · 2026-09-18
- Karpathy 描绘 LLM「认知内核」愿景,JEV 被视为其雏形 — Paimaamu · 2026-09-18