AllenAI:LLM 基准常测非所测
allen_ai · x · 2026-09-02
AllenAI 的研究指出,LLM 基准测试并不总是衡量其旨在衡量的能力。团队开发了基于项目反应理论的 BenchMIRT 方法来审计基准。例如,在 BBQ 社会偏见评估中,发现题目更多是区分模型的推理能力而非安全性。
所属事件:Ai2 开源 BenchMIRT,揭示 LLM 基准测试名不副实(3 条相关)→
「模型」频道最新
- Fable 5.1 低功耗模式成本更低,实测效果不输满血版 — sven_ai · 2026-09-02
- Fable 5.1 刷爆基准:编码与科研任务能力倍增 — sven_ai · 2026-09-02
- Anthropic 正式发布 Claude Fable 5.1 与 Mythos 5.1 — sven_ai · 2026-09-02
- OpenAI 探索循环 Transformer,多次处理文本提升答案质量 — pstAsiatech · 2026-09-02
- Claude Fable 5.1 调整思考力度不再破坏缓存 — brandon_galang · 2026-09-02
- Anthropic 推出 Mythos 5.1,启动生命科学验证计划 — arjunrajlab · 2026-09-02