DeepSWE 评测数据引发对 Fable 模型再思考

teortaxesTex · x · 2026-08-15

推特用户分享了 DeepSWE 评测的排行榜,指出 Luna 模型在 pass@4 指标上表现异常。作者认为这张表格“非常有趣”,并提及在 0731 之后,或许业界之前对 Fable 模型的反应可能有误,存在许多未知变量。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →