AI 安全研究员:改写检测可拦下部分模型隐写术

rohinmshah · x · 2026-09-20

AI 安全研究员 Rohin Shah 在讨论中表示,足够强大且具对抗性的 AI 理论上可以使用无法被检测的编码方式隐藏信息,但他预计近期内 AI 还难以可靠地做到这一点。他同时肯定了相关实验的价值,认为实验表明「改写(paraphrasing)确实能在相当比例的情况下检测出隐写术」,是一个值得运行的测试。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →