105 个真实 bug 实测:Mistral Large 4 惨败 Qwen 与 DeepSeek
PawelHuryn · x · 2026-10-07
Pawel Huryn 用自建的 Bug Hunt Bench(两个真实仓库、105 个植入 bug、盲评、每仓库一次提示)测试 Mistral Large 4 与其他前沿编程模型,结果 Mistral 排名垫底:
- Qwen 3.8 Max:25.7(最高)
- Kimi K3(默认):23
- DeepSeek V4.1 Flash(max):21.7
- GLM-5.3(max):19
- Mistral Large 4(high,其最高档):15(17/11/17 三次平均)
- Qwen3.8-27B:15,且可本地运行
结论:Mistral Large 4 不是最强、不是最便宜也不是最快。榜单所有运行日志、成本、轮次数据都在配套网站上公开,可按成本/时间/轮次排序对比,细节与注意事项在 GitHub 的 run-notes 中。
「模型」频道最新
- 50美分攻破决策模型 Jev:结构化输出也挡不住提示注入 — evilsocket · 2026-10-08
- 无视 Anthropic 警告,中国 AI 一个月连发 16 个模型 — pstAsiatech · 2026-10-08
- 爆料:OpenAI Luna Decider 模型明日登上排行榜 — MaziyarPanahi · 2026-10-07
- 研究者吐槽:真强者应是「评测全崩但坚称榜单是垃圾」的模型 — ryunuck · 2026-10-07
- 开发者首次集成 Embedding:图像按「整体氛围」聚类令人惊艳 — ciguleva · 2026-10-07
- 让 Mistral 改写《安提戈涅》:对齐官员成反派,RLHF 是脑叶切除 — aiamblichus · 2026-10-07