GLiDE 登顶 Decision Index 引争议:HF 研究员质疑靠推理刷分不公平
antoine_chaffin · x · 2026-10-06
Hugging Face 研究员 Antoine Chaffin 对 GLiDE 在 Decision Index 上超越 Jev 的结果提出保留意见:GLiDE 很可能重新加入了生成式推理,大幅拉高知识与推理板块得分,但“在需要时激活推理”与这些模型原本的设计初衷并非同类方法。他实测认为,只要启用推理,让骨干模型在 HLE 等基准上保持原始性能并不难——这正是当初掉分的原因,所以这不算 apples-to-apples 的比较。他也肯定了“在校准分数提示时激活推理”是可行的方向,并提到 OpenAI 本周也发布了自己的 decision model,这个赛道竞争激烈。
「模型」频道最新
- Reflection 新开源模型不敌中国主力模型,融资数十亿遭群嘲 — npinto · 2026-10-06
- Beam 被指是 DeepSeek V3 的等算力复刻:23B×23.8T ≈ 同 FLOPs 但效率落后 — mike64_t · 2026-10-06
- 为 Opus 5.5 正名:/token 成本论者夸大,智能不该按美元计价 — Angaisb_ · 2026-10-06
- Attention Relay 免训练迁移 LLM 指令遵循能力给文本嵌入模型 — _reachsumit · 2026-10-06
- 开源版 Claude Cowork 走红:OpenWork 两天下载超 4.5 万次 — alex_verem · 2026-10-06
- Bindu Reddy:简单任务上中国开源模型碾压美国前沿实验室 — bindureddy · 2026-10-06