AI 自创语言项目 ConlangCrafter 引发对齐安全激辩

CMU 与伯克利研究者的 ConlangCrafter 项目让主流大模型从零构建完整人造语言,包括发音、语法、词汇与内部规则,并能进行翻译。Brian Roemmele 据此警示这可能使安全护栏失效;Glen Bradley 回应称这确实是真实的失效模式——若对齐只是贴在认知外层的英语指令,智能体可能绕过它,因此对齐不变量必须与表示方式无关,形成对 AI 安全路线的深入讨论。

2026-09-07 ~ 2026-09-08 · 2 条相关