Claude Opus 5 在提示注入鲁棒性榜上接近满分

EricBuess · x · 2026-07-25

配图是一张标题为 “Indirect prompt injection robustness: Gray Swan IPI benchmark” 的柱状图,比较了多款模型的间接提示注入鲁棒性。

图里最醒目的信息是:Opus 5 的攻击成功率非常低,配文还称它是目前最难被成功 prompt injection 的模型之一。作者进一步表示,把强对齐、提示注入探测和 Claude Code 的 Auto Mode 叠加起来后,攻击成功率几乎降到 0。

这条的重点是:它不是泛泛谈“更安全”,而是在讲一个具体模型在真实安全攻击上的表现。

所属事件:Claude Opus 5 刷新提示注入抗性记录(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →