GLM 5.3 SlopCodeBench 评测:严格通过率 47%
corruptbytes · reddit · 2026-08-21
测试者在 SlopCodeBench 上对 GLM 5.3 进行了评测,意外运行了全部 36 个问题。结果显示,GLM 5.3 在 17 个检查点的列表中严格通过率为 47.1%(8/17),在 30 个检查点的列表中为 33.3%(10/30),表现与 Fable 5 和 GPT-5.6 Sol 持平。测试还发现题目难度与解决所需的 token 输出量呈正相关。
「模型」频道最新
- Agent Arena 榜单:Claude Opus 5 领跑真实智能体任务 — arena · 2026-08-21
- Muse Spark 1.2 上线:Bash 恢复率涨 11% — arena · 2026-08-21
- 工具 Vomit:用本地 LLM 离线清洗 Claude 5 的乱码输出 — petrusenko_max · 2026-08-21
- Hugging Face 发布 LFM2.5-DSpark,推理速度最高提升 3.2 倍 — Hugging Face Blog · 2026-08-21
- QwenMix-3.7:合并 Qwen3.8 与 3.6 的实验性模型 — bigattichouse · 2026-08-21
- ChatGPT 现随机触发数据分析幻觉 — olivia_x3 · 2026-08-21