「安全靠提示词」行不通:LLM 本质是软程序,需外部确定性管控

gerardsans · x · 2026-09-14

有观点的安全讨论:作者批评 AI 行业长期搞「安全表演」(safety theatre),指出 prompt 本身没有安全边界——指令、思维链、外部数据、观察和工具全部混在同一上下文里,事实、谎言与越狱攻击都只差一次工具调用,设计上就不安全。

他的核心论点:靠堆更多指令或梯度下降无法解决安全问题,因为 LLM 不是「心智」,而是一个数学对象、一个软程序(soft program)。出路是确定性的、可审计的外部控制,而不是围绕一个并不存在的「心智」继续空谈对齐。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →