Ai2 开源 BenchMIRT 审计 LLM 基准测试
AllenAI(Ai2)发布并开源了 BenchMIRT 工具及相关论文,这是一种基于项目反应理论(IRT)的新方法,可分析基准测试中单个问题实际测量的模型能力。研究发现,旨在测试社会偏见的 BBQ 基准实际测得的是推理能力而非偏见。该工具还能估计模型在未回答问题上的表现,帮助研究者构建更小、更聚焦且易于解释的评估方法。
2026-09-02 ~ 2026-09-02 · 2 条相关
- Ai2 发布 BenchMIRT 审计 LLM 基准,揭露 BBQ 实测推理而非偏见 — allen_ai · 2026-09-02
- AllenAI 开源 BenchMIRT:解构 LLM 基准评估 — allen_ai · 2026-09-02