Cisco LLM 安全排行榜扩至文本图像音频,已评测 136 个模型
aminkarbasi · x · 2026-09-25
Cisco 更新其 LLM Security Leaderboard,将模型安全评测扩展到文本、图像、音频三种模态——正是 agent 场景中最容易暴露风险的输入面,6 月以来新增 102 项评测,现已覆盖 136 个模型。
排行榜主要测试两类攻击:
- Prompt injection:恶意指令藏在模型处理的网页、图片等内容中
- 越狱(jailbreak):诱导模型无视自身安全规则
Cisco 强调,风险因部署方式而异:接入浏览类 agent 的模型在多模态输入上暴露面远大于纯聊天窗口,因此了解模型在哪些模态、哪些输入上薄弱,与知道它强在哪同样重要。
「安全」频道最新
- 谷歌用搜索与 YouTube 历史估算加拿大用户是否未满 18 岁 — WellsLucasSanto · 2026-09-25
- 男子为情妇写的 AI 生成歌曲在杀妻案庭审中成为检方证据 — Polymarket · 2026-09-25
- Altimeter 创始人:OpenAI 解 Navier-Stokes 模型因审查未公开发布 — rohanpaul_ai · 2026-09-25
- Palo Alto 四件安全产品打包,专攻 AI 编码 Agent 的企业安全 — shashib · 2026-09-25
- 政策人士追问 Anthropic:何种条件下会单方面暂停 AI 开发? — dgrobinson · 2026-09-25
- 美国会 ASI 禁令法案获 10 名众议员联署,倡导者称运动壮大 — erikphoel · 2026-09-25