斯坦福教授辩安全:训练、权限、循环都可修,隐藏恶意目标才是难题

anshulkundaje · x · 2026-09-16

斯坦福教授 Anshul Kundaje 与 Vishal Misra 就"减速大模型"展开讨论。Misra 认为行业所谓放慢速度的方向不对——问题不在训练本身;Kundaje 回应称,厂商指的是放慢发布节奏,以便评估模型错位程度、修补外部漏洞,但竞争激励会让尽调缩水。

Kundaje 进一步指出这不只是语义之争:训练数据、prompt、状态、权限和 agent 循环都是当下可以实际修复的问题;而一个带着持久隐藏欲望、能自我改进的"小反派"才是真正的工程难题。当前范式非常脆弱,高度依赖训练数据的选择,行为在无意的错位区域难以预测。

所属事件:斯坦福教授激辩对齐:隐藏恶意目标才是真正难题(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →