AI2 发布 BenchMIRT:审计 LLM 基准到底测了啥

Hugging Face Blog · rss · 2026-09-02

AI2 推出了 BenchMIRT,这是一种用于逐题审计 LLM 基准测试的新方法。它能揭示基准实际上测量了哪些能力,帮助研究人员构建更小、更专注且更易于解释的评估体系。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →