Multi-group IRT 分解跨语言安全评测基准
sanmikoyejo · x · 2026-08-17
介绍了 Multi-group IRT 方法,该方法将跨语言安全评测的聚合得分分解为四个维度:语言无关的安全鲁棒性、内在提示词难度、全局语言处理难度以及提示词特定的跨语言安全差距。该研究基于 MultiJail 数据集,覆盖了 61 种模型配置和 10 种语言。
所属事件:论文解析 LLM 跨语言安全护栏退化 英语竟更易失效(4 条相关)→
「研究」频道最新
- RLHF 训练下 Temperature=1.0 优于经验值 — jessi_cata · 2026-08-17
- 生物预测模型常被简单基线击败?这本指南讲了原因 — HongyiWang10 · 2026-08-17
- 《自然》「科学颠覆性下降」论文:审稿人早已发现方法硬伤 — RexDouglass · 2026-08-17
- multiPL-e 数据集现低级错误,Rust 指令变写“rsthon” — code_star · 2026-08-17
- 观点:应用 10 万美元算力求解胜过数十年人工搜索 — littmath · 2026-08-17
- 新论文探索人机共创中的显性、隐性及新规则 — sebkrier · 2026-08-17