AI 安全策略应像物理学:用不变量控制可达状态

pstryder · reddit · 2026-08-09

作者从压缩 AI 人格提示词的经验出发,指出隐喻(如“带牙的老婆”)是高效的行为吸引子,能让模型自动补全未指定的行为特征。然而,这种基于自然语言的模糊性在安全领域极其脆弱。

作者提出,AI 安全策略不应依赖自然语言列举具体动作(如“不要执行破坏性命令”),因为这极易被绕过。相反,安全机制应借鉴物理学概念,从“控制动作”转向“控制可达状态”,通过设定系统的不变量来从根本上约束模型的行为边界。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →