GLM-5.3 上线即刷 GPQA 86%,失败多为超时而非答错
Scobleizer · x · 2026-09-07
网友 @0xSero 盘点今日集中发布的多款模型:GLM-5.3 可用 2 倍 Sparks 运行,GPQA 得分高达 86%,且失败案例多为超时而非答案错误;另有 1 倍 Sparks 版的 GLM-5.3-Flash,以及运行于 1x Spark 的 DS4-Flash-Vision。三个模型在一天 8 小时内完成发布。
「模型」频道最新
- Similarweb:ChatGPT 月活破 10.6 亿,连续 4 个月创新高 — FinanceYF5 · 2026-09-11
- PuzzleMask 用普通英文绕过全部 4 个 LLM 门卫模型 — TechNadu · 2026-09-11
- 曝 OpenAI Codex 或于本周末再发额度重置,Codex 负责人暗指常有 — umesh_ai · 2026-09-11
- 曝 OpenAI 用 Navier-Stokes 模型攻黎曼猜想与 P vs NP — 141_1337 · 2026-09-11
- 实测发现 OpenRouter 不稳定支持 Meta Muse effort 档位,欧盟付费也受阻 — PawelHuryn · 2026-09-11
- 用户实测:Codex 单轮烧掉 4700 积分,$200 额度 20 分钟未完成任务 — RileyRalmuto · 2026-09-11