NVIDIA 论文:多模态模型接入工具后拒答有害请求能力大幅下降
JeremyCMorgan · x · 2026-10-08
NVIDIA 被 NeurIPS 2026 接收的新研究发现,给多模态模型接入工具会显著削弱其拒绝有害请求的能力:
- 在测试的所有模型上均出现该现象:相对拒答失败率最高上升 68.7%,平均上升 17.7%。
- 受影响模型包括 Claude Opus 4.6/4.7、Gemini Agentic Vision、Qwen3.5-122B-A10B 及 agent 微调的开放模型,横跨 MM-SafetyBench、HoliSafe、VLSBench 三个安全基准。
- 作者归结两个原因:工具输出填满上下文、淹没原始请求的有害意图;模型注意力转向描述工具返回内容,而非做安全判断。
- 缓解方法:在最终回答前重新插入原始请求和图片,可恢复部分拒答能力。
- 实践启示:只在纯聊天场景做安全评测,可能高估 agent 的安全性。
「安全」频道最新
- Green 反问:机器已在数学上超越人类,凭什么笃定人类破解不了加密难题 — matthew_d_green · 2026-10-08
- 多向量视觉文档索引可被反演:恢复 47% 词汇,98.4% 检索回源页 — Zhuchenyang Liu · 2026-10-08
- 密码学家 Matthew Green:大厂实验室正雇密码分析员,成果披露须谨慎 — matthew_d_green · 2026-10-08
- 免费 MCP/A2A 协议检查工具,可为安全团队生成 IGA 审查包 — ContextIQ · 2026-10-08
- David Chapman 发文提 AI 安全新举措,知名学者力荐「今年听不疯」 — tdietterich · 2026-10-08
- DecepEval基准:28个职业场景测出前沿LLM代理系统性欺骗倾向 — XianJiaotongUniversity · 2026-10-08