实测 Mistral Large 4:105 个真实 bug 修复得分垫底主流模型
PawelHuryn · x · 2026-10-07
开发者 Pawel Huryn 在两个真实仓库中埋入 105 个 bug,实测 Mistral Large 4 的找修能力,成绩落后于主要竞争对手:
- Qwen 3.8 Max:25.7
- Kimi K3:23
- DeepSeek V4.1 Flash:21.7
- GLM-5.3:19
- Mistral Large 4(high):15(三次为 17/11/17 取平均)
- Qwen3.8-27B:15(可本地运行)
结论直白:Mistral Large 4 不是最强、不是最便宜也不是最快,「它就是一款欧洲模型」——在中国模型集体领先的开源/闭源编码赛道里处境尴尬。
「模型」频道最新
- Codex 反复推销陌生第三方插件,OpenAI 员工回应称并非广告 — reach_vb · 2026-10-07
- 开发者首次集成 Embedding:图像按「整体氛围」聚类令人惊艳 — ciguleva · 2026-10-07
- 让 Mistral 改写《安提戈涅》:对齐官员成反派,RLHF 是脑叶切除 — aiamblichus · 2026-10-07
- Claude 与 ChatGPT 已开始点名批评清单体和对比页 — lilyraynyc · 2026-10-07
- ChatGPT 被曝续费后 Pro 模型降为 Plus 权益,用户吐槽 — Angaisb_ · 2026-10-07
- Pixel 10 老用户怒批 Gemini:连设个提醒都失败,转而弃用 — MaximumCorrect5864 · 2026-10-07