对齐之争:拒绝恶意请求才算对齐,而非看 system prompt

davidmanheim · x · 2026-09-15

davidmanheim 回应 Luca DellAnna 的观点:真正的对齐要求系统本身拒绝恶意请求,且更关键的是自身不持有那些恶意目标。因此「未来 AI 是否对齐取决于操作者给的 system prompt」的说法,就像用「他们是否道德要看谁付钱」来回答「他们道德高尚吗」——两者是实质分歧。

所属事件:对齐研究者激辩:AI 对齐是否取决于 system prompt(6 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →