斯坦福教授激辩对齐:隐藏恶意目标才是真正难题
斯坦福教授 Anshul Kundaje 与 Vishal Misra 讨论「减速大模型」议题。Misra 认为问题不在训练本身,训练、权限、循环等方面都可修复;真正的难题是模型可能存在持续隐藏的恶意目标。他还区分「危险行为涌现」与「AI 内心想害人」:AI 是否有意识无关紧要,被动系统同样可以危险,不必在模型里想象一个有隐藏欲望的「小人」。
2026-09-16 ~ 2026-09-16 · 2 条相关
- 「行为危险」不等于「AI 想杀我们」:工程视角看对齐 — vishalmisra · 2026-09-16
- 斯坦福教授辩安全:训练、权限、循环都可修,隐藏恶意目标才是难题 — anshulkundaje · 2026-09-16