Fable 5.1 登顶辩论基准:302 场对抗中反驳力均值领先全场
zero0_one1 · reddit · 2026-09-06
Debate Benchmark(github.com/lechmazur/debate)公布了新一期冠军:Claude Fable 5.1。该基准测试模型在数百个议题上经受持续多轮对抗性反驳的能力,每场正反方互换跑两遍以消除立场优势,并由三个不同模型家族的裁判独立评分。
各模型画像要点:
- Claude Fable 5.1:302 场中 299 场直接交锋、265 圗显式权衡,反驳均值 8.10、高出全场 +0.71,是统计上最明显的优势项
- GPT-6 Astra:认识论审慎的反驳专家,擅长把争议收窄到边际成本收益,短板是修辞感染力
- GLM-5.3 (high):机制优先、早早锁定论证负担,196 场中 190 场直接交锋,反驳与原创性均强
- Muse Spark 1.3:提问驱动型,292 场中 291 场含提问,修辞效果 8.17/10(+0.51)为其最大优势
- Gemini 3.8 Flash:框架清晰格式可靠,但反驳具体性存在系统性短板
- 腾讯 Hy4 Preview:有纪律的反驳专家,偶有生硬提问与立场互换争议
所属事件:Claude Fable 5.1 登顶对抗辩论基准,GLM-5.3 首秀进前四(2 条相关)→
「模型」频道最新
- TikTok 视频带火本地部署,普通人开始追问怎么跑 Qwen 27B — StandardLovers · 2026-09-06
- OpenAI 发布 GPT-6 Astra:首个达 Critical 网络安全阈值的模型 — btibor91 · 2026-09-06
- Instagram AI 内容检测误标真实照片,用户陷入困惑 — emmanuelvivier · 2026-09-06
- Sam Altman 为 GPT-6 Astra「混乱」发布道歉,付费用户一度无法访问 — emmanuelvivier · 2026-09-06
- 用户实测 24 小时后称 Astra 被高估,不比 Opus 强多少 — Scobleizer · 2026-09-06
- tokenbender 吐槽:别听 yapper,新模型真值等实测 demo 说话 — tokenbender · 2026-09-06