小米 MiMo-V2.6-Pro 实测修 105 个真实 bug:22.7 分仅花 $0.86
PawelHuryn · x · 2026-09-22
Pawel Huryn 在小米刚发布的 MiMo-V2.6-Pro 上做了真实工作场景测试:2 个代码仓库、105 个真实 bug,盲评打分。
- Muse Spark 1.3 (max):32.2 分,$18.11
- GPT-5.6 Luna (max):31.5 分,$2.82
- Grok 4.7 (xhigh):28.8 分,$22.89
- MiMo-V2.6-Pro (default):22.7 分,仅 $0.86
- DeepSeek V4.1 Flash (max):21.7 分,$0.78
- Gemini 3.8 Flash (high):18 分,$11.03
结论:MiMo-V2.6-Pro 和 DeepSeek V4.1 Flash 构成很强的性价比 Pareto 前沿——分数接近头部模型,价格低一个数量级。作者认为即使补贴订阅消失,这类模型也完全可以日常使用。除 Luna 外均取 3 次以上运行的中位数。
所属事件:Bug Hunt Bench 实测 105 个真实漏洞:模型成本相差近 200 倍(3 条相关)→
「模型」频道最新
- 实测:MiMo-V2.6 Flash 跑通百步临床 Agent 工作流,速度飞快 — MaziyarPanahi · 2026-09-22
- Ramp 数据:GPT-6 Astra 企业支出份额超 Claude Opus 5 登顶 — firstadopter · 2026-09-22
- 86 道物理题各跑 100 遍:模型校准实测 87.6% 准确率 — Ok-Challenge-7810 · 2026-09-22
- 曝 DeepSeek 押注华为芯片训练新模型,梁文锋称「必须成」 — kimmonismus · 2026-09-22
- 小米 MiMo-V2.6-Pro 登顶开源模型,Anthropic 指其蒸馏 Claude 数据 — The Decoder · 2026-09-22
- 腾讯开放微信接口,上百 G 聊天数据处理终于可行 — Xianbao_QIAN · 2026-09-22