Fable 5.1 登顶对抗辩论基准,GLM-5.3 首秀冲进前四
teortaxesTex · x · 2026-09-06
LechMazur 发布的 LLM Debate Benchmark 更新排名:该基准测试模型在数百个话题上面对持续、对抗式多轮反驳时的辩论能力,每场对决交换立场跑两遍,由三模型评审团判胜负,并用 Bradley-Terry 评分(以 1500 为中心)排序。
主要结果:
- Fable 5.1 登顶,比 Fable 5 高出 11 分
- GPT-6 Astra 低于 GPT-5.6 Sol 达 39 分
- GLM-5.3 (high) 首秀即在现有模型中排第 4,较 GLM-5.2 max 从 1573 涨到 1653(+80)
- Hy4 Preview 涨幅最大:1395 → 1590(+195)
- Gemini 3.8 Flash 从 1463 升至 1524(+60)
- Muse Spark 1.3 反而比 1.1 低 46 分
发帖人 teortaxesTex 评论称 Fable 是「凶狠的 wordcel」,与「天真天才儿童」式的 Astra 形成鲜明的模型风格分化。基准代码开源在 GitHub(lechmazur/debate)。
所属事件:Claude Fable 5.1 登顶对抗辩论基准,GLM-5.3 首秀进前四(2 条相关)→
「模型」频道最新
- GPT6 Astra 推理档位实测:MAX 耗时 20 分钟,medium 仅 5 分钟 — bdsqlsz · 2026-09-06
- 长文推演 GPT-6 后继模型:从聊天机器人到留机跑一周的同事 — johnseach · 2026-09-06
- 传 OpenAI 砍掉 Sora 与 Atlas 转向 Astra 和编码模型 — sahilypatel · 2026-09-06
- Pangram 公开全部技术细节:训练、数据、架构与评测全披露 — zainhas · 2026-09-06
- 用 GPT Astra 6 搭插管训练模拟器,此前各家模型都做砸 — BraydonDymm · 2026-09-06
- 网友吐槽开源模型 Astra 太费 token,喊话出一个 GPT-6 级 Sol — CtrlAltDwayne · 2026-09-06