AI 安全研究员:改写检测可拦下部分模型隐写术
rohinmshah · x · 2026-09-20
AI 安全研究员 Rohin Shah 在讨论中表示,足够强大且具对抗性的 AI 理论上可以使用无法被检测的编码方式隐藏信息,但他预计近期内 AI 还难以可靠地做到这一点。他同时肯定了相关实验的价值,认为实验表明「改写(paraphrasing)确实能在相当比例的情况下检测出隐写术」,是一个值得运行的测试。
「安全」频道最新
- 学者做客 CBS:AI 透明度不该靠诉讼倒逼,需独立监督机制 — chrismattmann · 2026-09-20
- Gary Marcus 警告:AI 智能体 swarm 散布虚假信息的噩梦正在成真 — GaryMarcus · 2026-09-20
- Gary Marcus 警告:AI agent 大军生成假信息正成现实 — GaryMarcus · 2026-09-20
- Gary Marcus:AI 智能体群散播虚假信息警报正在应验 — GaryMarcus · 2026-09-20
- Andrew Yang 称网络已被自复制 AI 代码污染,仅二手信源 — alex_verem · 2026-09-20
- GLiNER2 作者发声:Jev 的能力并不新,我们的模型早已开源 — philipvollet · 2026-09-20