GPT-6 Astra 幻觉更少,但隐藏注入攻击下仍 8.5% 被攻破

The Decoder · rss · 2026-09-05

据 The Decoder 报道,OpenAI 的 GPT-6 Astra 幻觉比前代更少,并能拦截 99.99% 的直接 prompt injection。但当攻击指令隐藏在模型阅读的文档内部时,模型仍有 8.5% 的场景被攻破;Claude Opus 5 表现更好,为 4.8%。对要处理真实数据的自主智能体而言,这些数字仍然偏高,暴露出间接注入攻击仍是前沿模型安全的短板。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →