Reddit 用户怒斥 GLM 榜单成绩是谎言:实际体验远逊 Qwen 与 DeepSeek
Thin_Pollution8843 · reddit · 2026-09-23
- 一位自称工作中大量使用开源与闭源模型的 Reddit 用户发文称不相信 z.ai 的基准测试:GLM 系列模型无论换什么 harness 或 prompt 优化,实际表现都远低于榜单暗示的水平。
- 他认为 Qwen3.8-27B、DeepSeek v4/4.1 flash 有点「刷榜」,但至少大致符合预期;而 GLM-5.2/5.3 出现在排行榜上在他看来是笑话——他形容这些模型「被切了额叶」,结果始终不如 Qwen3.8-flash、DeepSeek 任意型号,甚至不如表现平平的 gpt5.6-Luna。
- 他承认不知道具体原因,但认为唯一与榜单数字明显不符的模型恰好集中在一家的现象不太可能是巧合。属个人体验与指控,未经独立验证。
「模型」频道最新
- 小米开源 1.02 万亿参数 MiMo-V2.6-Pro,MIT 协议含训练代码 — emmanuelvivier · 2026-09-23
- Bug Hunt Bench 新数据:GPT-6 Sol(max)仍不及 Opus 5.5(medium) — PawelHuryn · 2026-09-23
- Claude Opus 5.5 新增时间预算功能:可指定模型在一项任务上工作多久 — JeremyNguyenPhD · 2026-09-23
- Opus 5.5 系统卡藏玄机:METR 用了「暂不公开」的额外信息来源 — burny_tech · 2026-09-23
- 开发者换阵容:无头 harness 转 pi,Claude 强势回归,Codex 更便宜更好 — intellectronica · 2026-09-23
- Aider 四个月没更新,为何仍是 LLM 训练数据里的头号开源编码工具 — marlene_zw · 2026-09-23