SlopCodeBench 横评:GPT-6 Astra 21% 领跑,GLM 5.3 High 达 19%
teropa · x · 2026-09-06
dexhorthy 更新自建的 SlopCodeBench 编码基准,首次在多模型上按不同思考强度(effort 设置)对比:GPT-6 Astra Xhigh 得分 21%(仍在跑)、GPT-5.6 Sol XHigh 18%(进行中)、Fable 5.1 Medium 11%、GPT-5.6 Sol medium 11%、GLM 5.3 Medium 7%、GLM 5.3 High 19%(进行中)。作者指出思考强度不能在不同厂商之间直接换算;因 Fable 额度 4 天后重置,除非有人赞助额度,Fable 5.1 xhigh 只能等下周再测。
「模型」频道最新
- 用户实测本地跑 gemma4:31b-mlx:体验与付费订阅难以区分 — walkingriver · 2026-09-06
- 开发者摸索 AI 写作:结果渐入佳境但 token 与上下文消耗巨大 — willcb · 2026-09-06
- 「以前模型刷分,现在反过来是 benchmark 在刷模型」 — abeirami · 2026-09-06
- GPT-6 Astra 一个提示词不到 10 分钟建出完整应用 — RileyRalmuto · 2026-09-06
- Zvi 谈 Astra「不作弊」:模型先想会被抓再收手,反而更糟 — ZeroStateReflex · 2026-09-06
- Astra 表现平平遭全网找补,楼主吐槽:评测标准双标现场 — Tim_Apple_938 · 2026-09-06