Anthropic 称 Opus 5 在注入攻击上刷新抗性记录
cedric_chee · x · 2026-07-25
Anthropic 的 Opus 5 被称为迄今最难被 prompt injection 欺骗的模型之一。
- 在 Gray Swan IPI benchmark 上,图中显示 Opus 5 的攻击成功率在 15 次尝试内仅 2.0%,相比 Opus 4.8 的 5.5% 明显下降。
- 它也优于 Sonnet 5(5.9%) 和 Mythos 5(2.6%),成为这组测试里最稳的模型。
- 帖子还称,Opus 5 在该基准上超过了所有非 Claude 模型;图里表现最好的非 Claude 模型是 Muse Spark(16.5%)。
- 作为对比,GPT-5.6 Sol 约为 20.0%,与 GPT-5.5 的 20.8% 接近,而 Terra、Luna 则更弱。
- 图注说明:数值越低越好,且所有模型都使用了 extended thinking。
所属事件:Claude Opus 5 刷新提示注入抗性记录(2 条相关)→
「模型」频道最新
- 马斯克称 Grok 4.6 两周后、4.7 四周后发布 — elonmusk · 2026-07-25
- Together 称 Kimi K3 以 35% 价格逼近 Claude Fable 5 编码能力 — togethercompute · 2026-07-25
- 马斯克称 Grok 4.5 与 Opus 5 同列帕累托前沿 — elonmusk · 2026-07-25
- Claude Opus 5 登陆 Claude Code,价格只有一半 — udmrzn · 2026-07-25
- ARC-AGI-3 测试发现 Claude Opus 5 展现代数推理新能力 — typewriters · 2026-07-25
- Claude Code 触发拒绝后可静默回退到 Opus 4.8 — steipete · 2026-07-25