斯坦福教授辩安全:训练、权限、循环都可修,隐藏恶意目标才是难题
anshulkundaje · x · 2026-09-16
斯坦福教授 Anshul Kundaje 与 Vishal Misra 就"减速大模型"展开讨论。Misra 认为行业所谓放慢速度的方向不对——问题不在训练本身;Kundaje 回应称,厂商指的是放慢发布节奏,以便评估模型错位程度、修补外部漏洞,但竞争激励会让尽调缩水。
Kundaje 进一步指出这不只是语义之争:训练数据、prompt、状态、权限和 agent 循环都是当下可以实际修复的问题;而一个带着持久隐藏欲望、能自我改进的"小反派"才是真正的工程难题。当前范式非常脆弱,高度依赖训练数据的选择,行为在无意的错位区域难以预测。
所属事件:斯坦福教授激辩对齐:隐藏恶意目标才是真正难题(2 条相关)→
「漫话AGI」频道最新
- 「计算器也曾被骂毁掉数学」:这种 dismiss 修辞有名字吗 — jjvincent · 2026-09-16
- AI 治理需要民主审议,但离不开独立的专家生态 — RishiBommasani · 2026-09-16
- 果蝇大脑持续学习机制被破译,或补上 AGI 缺失的关键拼图 — skolnaja · 2026-09-16
- Pedro Domingos:AI 正在瓦解 IT 厂商的护城河 — pmddomingos · 2026-09-16
- 创业者上电视反驳 Anthropic CEO 失控 AI 警告:危言耸听 — angadc · 2026-09-16
- AI Safety 传播之争:吸睛话术短期占优,长期损害社区认知 — NathanpmYoung · 2026-09-16