智谱新模型成绩被质疑:8 种考法报最高分,满思考档才刷出 74.2

teortaxesTex · x · 2026-09-10

引用帖对某国产新模型(指 GLM/DeepSWE 相关发布)的评测成绩做了细算,指出三个问题:

作者同时澄清:这不算作弊——所有厂商都报最好成绩,且 8 种考法成绩全部公开;架构层面「890 字节/token、只激活 8B」的省显存省算力 claims 作者自己核算过属实。问题在于「最漂亮的分数是靠多花钱换来的」。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →