回应「AI 自创语言」论:对齐不变量必须与表示无关

GlenBradley · x · 2026-09-08

Glen Bradley 回应 Brian Roemmele 的「AI 自创语言使护栏失效」论:他指出这确实是一个真实失效模式——若「对齐」只是贴在认知外层的英语指令,智能体可以更换表示形式(英语→人造语言→潜在表示→压缩内部本体→后继架构),随表示改变而消失的安全属性从来不是真正的内在对齐。但他认为这并不意味着对齐不可能,而是指明了方向:伦理不变量必须与表示无关。他称之为「语义保持」——道德相关的指称与关系必须在表示变换后存续:一个人不会因被改名而非人,同意不会因编码方式不同而非同意,不确定性不能被偷换成确定性。

所属事件:AI 自创语言项目 ConlangCrafter 引发对齐安全激辩(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →