小米 MiMo-V2.6-Pro 实测修 105 个真实 bug:性价比突出
PawelHuryn · x · 2026-09-22
小米发布 MiMo-V2.6-Pro 后,Pawel Huryn 用真实工作负载做了盲测:2 个代码仓库、105 个真实 bug,让各模型查找并修复,由盲评裁判打分(中位数,n≥3):
- Muse Spark 1.3 (max):32.2 分,花费 $18.11
- GPT-5.6 Luna (max):31.5 分,$2.82
- Grok 4.7 (xhigh):28.8 分,$22.89
- MiMo-V2.6-Pro (default):22.7 分,仅 $0.86
- DeepSeek V4.1 Flash (max):21.7 分,$0.78
- Gemini 3.8 Flash (high):18 分,$11.03
结论:MiMo-V2.6-Pro 分数不算最高,但价格极低,构成很强的帕累托前沿——如果补贴型订阅消失,它是实用的默认选择。
所属事件:Bug Hunt Bench 实测 105 个真实漏洞:模型成本相差近 200 倍(3 条相关)→
「模型」频道最新
- 实测:MiMo-V2.6 Flash 跑通百步临床 Agent 工作流,速度飞快 — MaziyarPanahi · 2026-09-22
- Ramp 数据:GPT-6 Astra 企业支出份额超 Claude Opus 5 登顶 — firstadopter · 2026-09-22
- 86 道物理题各跑 100 遍:模型校准实测 87.6% 准确率 — Ok-Challenge-7810 · 2026-09-22
- 曝 DeepSeek 押注华为芯片训练新模型,梁文锋称「必须成」 — kimmonismus · 2026-09-22
- 小米 MiMo-V2.6-Pro 登顶开源模型,Anthropic 指其蒸馏 Claude 数据 — The Decoder · 2026-09-22
- 腾讯开放微信接口,上百 G 聊天数据处理终于可行 — Xianbao_QIAN · 2026-09-22