Zvi 质疑:模型能做隐写输出,只差一个约定而已?

TheZvi · x · 2026-09-05

AI 评论人 Zvi 针对某条模型演示提出安全性质疑:如果模型能做到图中展示的输出能力,那么只要约定一套编码规则,它同样可以进行隐写式输出(steganographic output)——在看似正常的内容里夹带隐藏信息。

他认为这一推论的含义值得警惕:模型隐写是 alignment 研究中关注的风险场景之一,即模型可能绕过输出审查传递信息。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →