GPT-5.6 Sol 暂居 MazeBench 榜首,Fable 5.1 或有望反超
patience_cave · x · 2026-09-04
patiencecave 补充说明 MazeBench 榜单情况:GPT-5.6 Sol 目前居首,主要因为其运行时间更长且成本更低;最新版 Fable 如果保持当前速度,有可能拿下第一。Fable 5.1 已跑到 10%,与 Fable 5 持平。
「模型」频道最新
- Muse Spark 1.3 实测:16K 体素 3D 场景 30+fps,逼近 GLM-5.3 与 GPT-5.6 Sol — cedric_chee · 2026-09-05
- Qwen3.8-27b 成他首个敢盲跑的本地模型:连续 Agent 工作 8 小时零失误 — Express_Quail_1493 · 2026-09-04
- GLM 推出四项免费活动:编码计划不限量、周末送 4 亿 token — Zai_org · 2026-09-04
- Muse Spark 1.3 三维体素场景实测:性能紧追 GLM-5.3 与 GPT-5.6 — cedric_chee · 2026-09-04
- 实测发现:设 reasoning effort 为 none,压缩上下文仍消耗推理 token — mhmazur · 2026-09-04
- 爆料讨论:OpenAI 或用合成 CoT 改写内化推理链 — cephaloform · 2026-09-04