Ai2 开源 BenchMIRT 审计 LLM 基准测试

AllenAI(Ai2)发布并开源了 BenchMIRT 工具及相关论文,这是一种基于项目反应理论(IRT)的新方法,可分析基准测试中单个问题实际测量的模型能力。研究发现,旨在测试社会偏见的 BBQ 基准实际测得的是推理能力而非偏见。该工具还能估计模型在未回答问题上的表现,帮助研究者构建更小、更聚焦且易于解释的评估方法。

2026-09-02 ~ 2026-09-02 · 2 条相关