研究:22种模型配置下英语安全性比低资源语言更差
sanmikoyejo · x · 2026-08-17
研究团队使用多群组项目反应理论(Multi-group IRT)分析了61个模型配置在10种语言上的安全性。结果显示,安全能力在因子分析下主要表现为单一维度;令人惊讶的是,在22个配置中,英语比低资源语言更容易受到攻击,尽管这一反差并非普遍存在。
所属事件:论文解析 LLM 跨语言安全护栏退化 英语竟更易失效(4 条相关)→
「安全」频道最新
- 批评欧盟要求AI生成文本加水印 — antirez · 2026-08-17
- Zvi 谈 Anthropic 水印说服力:侧写样本作用有限 — TheZvi · 2026-08-17
- 讨论 Anthropic 水印技术潜在的追踪风险 — nptacek · 2026-08-17
- 桥水高管警告:未发布 AI 模型可造成重大损害,需提前行动 — austinc3301 · 2026-08-17
- OpenAI据报解散预备团队,安全评估职责分散至现有部门 — The Verge AI · 2026-08-17
- Anthropic 押注制药恐致高能生物模型双用风险 — Afinetheorem · 2026-08-17