105 个真实 bug 实测:Mistral Large 4 编程能力垫底主流模型
开发者 Pawel Huryn 用自建的 Bug Hunt Bench——在两个真实仓库中植入 105 个 bug,采用盲评、每个仓库仅一次提示的设置——实测 Mistral Large 4 的找 bug 与修复能力。结果显示 Mistral Large 4 成绩垫底,落后于主要竞争对手,包括 Qwen 3.8 Max 与 DeepSeek 等前沿编程模型,反映出其在前沿编程模型竞争中处于明显弱势。
2026-10-07 ~ 2026-10-07 · 2 条相关
- 实测 Mistral Large 4:105 个真实 bug 修复得分垫底主流模型 — PawelHuryn · 2026-10-07
- 105 个真实 bug 实测:Mistral Large 4 惨败 Qwen 与 DeepSeek — PawelHuryn · 2026-10-07