Mistral 新模型 Le Chonk 盲测登顶:开源编程模型第一,总榜仅次 Opus 5
qtnx_ · x · 2026-10-07
Mistral 在发布 Mistral Large 4(代号 Le Chonk)时委托 Surge AI 做盲测人类评审,由 Surge 的专家软件工程师对五个前沿模型的代码质量进行评估。
- Le Chonk 在开源权重模型中排名第一,总榜第二,仅次于 Anthropic Opus 5
- Surge 强调其评测差异:单元测试只回答「能不能跑」,而人类代码评审回答「你会不会 merge」——能跑只是底线,专业品味与判断力才决定代码能否上线
- Mistral 团队回应称公开 benchmark 只提供部分反馈,这正是他们请 Surge 做盲测验证内部评测结果的原因
「模型」频道最新
- 「Astra 暂停综合征」刷屏:steering 或致模型沉默,OpenAI 有解法 — thursdai_pod · 2026-10-07
- 网传 Qwen4 Flash 疑为 400B 参数,规模对标 GLM 5.3 Flash — EAccelerate_42 · 2026-10-07
- Anthropic 扩大网络安全验证计划,分三级开放攻击性用途权限 — EricBuess · 2026-10-07
- Mistral Large 4.0 万亿参数开源权重月底发布 — cpldcpu · 2026-10-07
- Claude 以「推理抽取」为由拒绝展示思考过程,用户吐槽:推理才是好东西 — StewartalsopIII · 2026-10-07
- 网友吐槽 Grok 性格拧巴:先说 No 再替你把论证讲得更强 — gandamu_ml · 2026-10-07