Fable 5.1 登顶辩论基准:302 场对抗中反驳力均值领先全场

zero0_one1 · reddit · 2026-09-06

Debate Benchmark(github.com/lechmazur/debate)公布了新一期冠军:Claude Fable 5.1。该基准测试模型在数百个议题上经受持续多轮对抗性反驳的能力,每场正反方互换跑两遍以消除立场优势,并由三个不同模型家族的裁判独立评分。

各模型画像要点:

所属事件:Claude Fable 5.1 登顶对抗辩论基准,GLM-5.3 首秀进前四(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →