研究:22种模型配置下英语安全性比低资源语言更差

sanmikoyejo · x · 2026-08-17

研究团队使用多群组项目反应理论(Multi-group IRT)分析了61个模型配置在10种语言上的安全性。结果显示,安全能力在因子分析下主要表现为单一维度;令人惊讶的是,在22个配置中,英语比低资源语言更容易受到攻击,尽管这一反差并非普遍存在。

所属事件:论文解析 LLM 跨语言安全护栏退化 英语竟更易失效(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →