Multi-group IRT 分解跨语言安全评测基准

sanmikoyejo · x · 2026-08-17

介绍了 Multi-group IRT 方法,该方法将跨语言安全评测的聚合得分分解为四个维度:语言无关的安全鲁棒性、内在提示词难度、全局语言处理难度以及提示词特定的跨语言安全差距。该研究基于 MultiJail 数据集,覆盖了 61 种模型配置和 10 种语言。

所属事件:论文解析 LLM 跨语言安全护栏退化 英语竟更易失效(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →