基准测试结果差异引热议:推理类基准提升幅度最大
code_star · x · 2026-08-28
开发者 codestar 在讨论中提到 MultiPL-E 基准的测试结果,指出不同基准之间的成绩波动差异很大,值得探究是什么因素导致部分基准的方差远高于其他基准。一个观察是:所谓「推理」类基准(非知识型)在这轮变化中获得了最高的提升幅度。
所属事件:Qwen 稀疏注意力机制分析与 TileLang 内核发布(7 条相关)→
「研究」频道最新
- 研究员呼吁 AI 会议应亏本运营以补贴青年学者 — 3scorciav · 2026-08-28
- TTPO:无需标签的测试时策略优化 — Aozhe Wang · 2026-08-28
- Aphanta:诊断多模态推理的图像编辑中间态 — Fudan-University · 2026-08-28
- HydroGym:含 60+ 环境的流体控制 AI 训练场 — ricardovinuesa · 2026-08-28
- Miles 支持 Qwen 与 GLM 模型的高效 RL 训练 — ying11231 · 2026-08-28
- Miles-diffusion 推出 LoRA SFT 快速微调扩散模型 — ying11231 · 2026-08-28