GPT-6 Astra 幻觉更少,但隐藏注入攻击下仍 8.5% 被攻破
The Decoder · rss · 2026-09-05
据 The Decoder 报道,OpenAI 的 GPT-6 Astra 幻觉比前代更少,并能拦截 99.99% 的直接 prompt injection。但当攻击指令隐藏在模型阅读的文档内部时,模型仍有 8.5% 的场景被攻破;Claude Opus 5 表现更好,为 4.8%。对要处理真实数据的自主智能体而言,这些数字仍然偏高,暴露出间接注入攻击仍是前沿模型安全的短板。
「模型」频道最新
- 博主称 OpenAI 为病毒传播时刻专门优化了 3D 模型,却没当天发布 — bindureddy · 2026-09-05
- DeepSeek 拟在内蒙数据中心部署至少 16 万颗华为新一代 AI 芯片 — Polymarket · 2026-09-05
- Cognition:GPT-6 Astra 编码质量逼近 Fable 5,成本还低 64% — rohanpaul_ai · 2026-09-05
- Stratechery 周报:Anthropic 撤回数据保留政策、Nvidia 财报与 Meta 和解 — Stratechery · 2026-09-05
- 从未说过俄语,Claude 却突然用俄语回复用户 — roshbakeer · 2026-09-05
- OpenAI Astra 用「递归深度」新推理路径,但思维过程更难监控 — JacquesThibs · 2026-09-05