AI2 发布 BenchMIRT:审计 LLM 基准到底测了啥
Hugging Face Blog · rss · 2026-09-02
AI2 推出了 BenchMIRT,这是一种用于逐题审计 LLM 基准测试的新方法。它能揭示基准实际上测量了哪些能力,帮助研究人员构建更小、更专注且更易于解释的评估体系。
「研究」频道最新
- Gemini 空间智能系统:8 张照片生成 3D 数字孪生 — AI_Andrew · 2026-09-02
- 论文:AI 智能体正在将人类挤出监管循环 — mmitchell_ai · 2026-09-02
- Alignment Journal 邀请未发表的对齐论文投稿 — dhadfieldmenell · 2026-09-02
- Epoch 指数显示推理模型加速 AI 进步 — Jsevillamol · 2026-09-02
- 研究:人脑语言处理难以用简单预测解释,LLM 嵌入更胜一筹 — begusgasper · 2026-09-02
- 研究表明 AI 解读骨龄 X 光片优于临床医生 — zakkohane · 2026-09-02