Claude Opus 5 刷新提示注入抗性记录
Anthropic 发布的 Claude Opus 5 在 Gray Swan IPI 基准测试中表现优异,接近取得满分。该模型被官方称为迄今最难被间接提示注入攻击欺骗的 AI 模型之一,大幅刷新了抗性记录,展现出卓越的安全对齐与防御能力。
2026-07-25 ~ 2026-07-25 · 2 条相关
- Claude Opus 5 在提示注入鲁棒性榜上接近满分 — EricBuess · 2026-07-25
- Anthropic 称 Opus 5 在注入攻击上刷新抗性记录 — cedric_chee · 2026-07-25