斯坦福教授激辩对齐:隐藏恶意目标才是真正难题

斯坦福教授 Anshul Kundaje 与 Vishal Misra 讨论「减速大模型」议题。Misra 认为问题不在训练本身,训练、权限、循环等方面都可修复;真正的难题是模型可能存在持续隐藏的恶意目标。他还区分「危险行为涌现」与「AI 内心想害人」:AI 是否有意识无关紧要,被动系统同样可以危险,不必在模型里想象一个有隐藏欲望的「小人」。

2026-09-16 ~ 2026-09-16 · 2 条相关