Grok 4.7 仅列 HLE 第 21,GLM-5.3 与 Qwen 3.8 领跑榜单
himanshustwts · x · 2026-09-22
- 发帖人称 Grok 4.7 在 Humanity's Last Exam(HLE)榜单上仅排第 21 名。
- 榜单头部由 GLM-5.3、Qwen 3.8、Muse 1.3、DeepSeek v4.1 等模型占据,且在 TB 4.0 榜单上同样如此,领先幅度明显。
- 帖子反映开源/中国系模型在推理榜单上的领先态势。
所属事件:Grok 4.7 在 HLE 榜单仅列第 21,多款模型领跑(2 条相关)→
「模型」频道最新
- Reliquary-4B 发布:全网矿工贡献 rollout 的去中心化 RL 训练数学代码模型 — const_reborn · 2026-09-22
- 用户尝试诱导 Jev 幻觉,宣称「骗不动」 — BLUECOW009 · 2026-09-22
- REAP 剪枝 Qwen3.8-Flash-Next MLX 版实测:三个档位怎么选 — MensaProdigy · 2026-09-22
- 开发者自述:DeepSeek V4 NVFP4 优化后 192GB 只剩 2GB 余量 — HankYeomans · 2026-09-22
- OpenAI 研究员吐槽:语音模型为何还做不到真人式实时对话 — willdepue · 2026-09-22
- Ling-3.0-flash-VL 实测:截图生成网页代码仅 17 秒 — _jaydeepkarale · 2026-09-22