研究者质疑 LLM「错位效用函数」担忧是伪问题

一场关于 AI 对齐的争论引发质疑:有开发者认为,LLM 的内部机制特性决定了担心它们拥有「错位效用函数」几乎是自相矛盾的,将经典 AI 对齐担忧直接套用在 LLM 上并不成立。另有观点指出,人类的「论证」本就不是形式证明,而是一串模糊的、语文学层面「听起来可能对」的判断链,因此对这类 galaxy brain 式的结论应保持怀疑。

2026-10-05 ~ 2026-10-05 · 2 条相关