AllenAI:LLM 基准常测非所测

allen_ai · x · 2026-09-02

AllenAI 的研究指出,LLM 基准测试并不总是衡量其旨在衡量的能力。团队开发了基于项目反应理论的 BenchMIRT 方法来审计基准。例如,在 BBQ 社会偏见评估中,发现题目更多是区分模型的推理能力而非安全性。

所属事件:Ai2 开源 BenchMIRT,揭示 LLM 基准测试名不副实(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →