GLM 5.2 预设算错 2.667 倍
LiorOnAI · x · 2026-07-12
一组实测让 4 个前沿模型同时构建 KV-cache debugger,并要求给出精确公式、不能偷懒。
结果显示:
- 四个模型都把高难度算术部分做对了。
- 但 GLM 5.2 的一个预设算错了 2.667 倍,错误来自层数设定不对,而且没有警告。
- 其余四个预设都正常。
原帖作者强调:最便宜的模型反而是唯一在数学上出错的那个。
「模型」频道最新
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11