智谱新模型成绩被质疑:8 种考法报最高分,满思考档才刷出 74.2
teortaxesTex · x · 2026-09-10
引用帖对某国产新模型(指 GLM/DeepSWE 相关发布)的评测成绩做了细算,指出三个问题:
- 挑最好成绩报告:同一场考试用 8 种考法跑了 8 遍,成绩从 65.5 到 74.2 不等(平均 69.0),最终只报最高的 74.2;而对比的竞争对手只跑了一遍。号称以 74.2 险胜 Opus 5 的 74.0,但那 74.2 用的是别人的考法,用自家默认考法只有 72.6,其实是输的。
- 思考档位拉满:从中档提到最高档分数涨 8 分,但成本约 2.5 倍,且报告自己承认最高档性价比差——按日常推荐档位用,拿不到 74.2 这个数,与「便宜」的卖点相悖。
- 训练与评测同源:整个训练以这几套评测集当进度表,并挑考得好的存档继续练,因无对照组影响无法量化。
作者同时澄清:这不算作弊——所有厂商都报最好成绩,且 8 种考法成绩全部公开;架构层面「890 字节/token、只激活 8B」的省显存省算力 claims 作者自己核算过属实。问题在于「最漂亮的分数是靠多花钱换来的」。
「模型」频道最新
- IFM 发布 375B MoE 开源模型 K2-Horizon 登上 Hugging Face 热榜 — IFM · 2026-09-10
- 爆料称 DeepSeek v4.1 Flash 比肩或超越 GPT-5.6 Sol 与 Claude Opus 5 — airesearch12 · 2026-09-10
- DeepSeek V4.1 Flash 的 reasoning_effort 使用指南 — incarnadine72 · 2026-09-10
- Gemini 3.8 Flash 仅 3 轮对话自我纠错完成任务,作者晒演示 — Artistic_Solution117 · 2026-09-10
- 「外星架构」引发热议,博主建议叠加 recurrent depth 技术 — scaling01 · 2026-09-10
- 用户请愿 OpenAI 推 $400–600 重度档:$200 额度 48 小时烧光 — dragonwarrior_1 · 2026-09-10