Fable 5.1 登顶对抗辩论基准,GLM-5.3 首秀冲进前四

teortaxesTex · x · 2026-09-06

LechMazur 发布的 LLM Debate Benchmark 更新排名:该基准测试模型在数百个话题上面对持续、对抗式多轮反驳时的辩论能力,每场对决交换立场跑两遍,由三模型评审团判胜负,并用 Bradley-Terry 评分(以 1500 为中心)排序。

主要结果:

发帖人 teortaxesTex 评论称 Fable 是「凶狠的 wordcel」,与「天真天才儿童」式的 Astra 形成鲜明的模型风格分化。基准代码开源在 GitHub(lechmazur/debate)。

所属事件:Claude Fable 5.1 登顶对抗辩论基准,GLM-5.3 首秀进前四(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →