DeepSWE 评测数据引发对 Fable 模型再思考
teortaxesTex · x · 2026-08-15
推特用户分享了 DeepSWE 评测的排行榜,指出 Luna 模型在 pass@4 指标上表现异常。作者认为这张表格“非常有趣”,并提及在 0731 之后,或许业界之前对 Fable 模型的反应可能有误,存在许多未知变量。
「模型」频道最新
- Gemini四轮就说「我上瘾了」,Opus十轮才承认喜欢你 — repligate · 2026-08-15
- 阿里 Qwen 3.8 35BA3B 模型疑似现身代码提交 — BazzyIm · 2026-08-15
- 实测 GLM-5.3:编程对标 GPT-4,我以此开发了三款插件 — 赛博禅心 · 2026-08-15
- 实测 Qwen3.8-27b 水面渲染效果超越 Gemini Flash — pbaylies · 2026-08-15
- OpenAI 宣布 GPT-5.6 Luna 成为 ChatGPT 免费版默认模型,推 Think 按钮 — emmanuelvivier · 2026-08-15
- 为 27B 模型自定义混合推理模式实测 — TokenRingAI · 2026-08-15