Mistral Large 4 发布:总参 1.05T 只激活 49B,权重 10 月 27 日放出
赛博禅心 · wechat · 2026-10-06
Mistral 发布公开预览版 Mistral Large 4(绰号 LeChonk 大胖猫):总参数 1.05T、每 token 仅激活 49B 的细粒度 MoE,带 1.6B 视觉编码器,原生多模态,上下文 1M。从零训练,耗时两个月,用约 4000 张 Grace Blackwell,全部在欧洲自有机房完成;上一代 Large 3 为 675B 总参/41B 激活,用 3000 张 H200。
主要成绩(官方预览)
- DeepSWE 长链条软件工程:62%,超过 GLM-5.3(61%)、DeepSeek-V4-Pro(57%)、Qwen3.8Max(51%)
- Finch 企业财务基准:67%,与 DeepSeek-V4-Pro 持平
- Harvey 法律 Agent 测试:15% 全场最高,但整体均不及格
- 视觉定位 DIOR-RSVG:73%,超 GPT-6 Astra(68%);官方称在遥感、芯片设计等场景超闭源前沿模型
为什么放权重:官方把网络防御列在首位——安全团队需要不受闭源护栏限制地大规模扫描漏洞。训练语言超 160 种,可部署在自家服务器或欧盟区,回应客户对供应安全与可审计性的要求。已服务空客、ASML、汇丰等 125+ 大企业。
价格与节奏:API 已可用,输入 $0.68/M、缓存输入 $0.07/M、输出 $2.09/M(约半价);权重 10 月 27 日按自定许可证放出,强化学习仍在继续,分数还会涨。
梗背景:LeChonk 呼应今年 6 月网友虚构的 LeChatonFat 肥猫模型,Mensch 与 Andreessen 都参与过玩梗。
所属事件:Mistral 发布 1T 参数多模态开源模型 Large 4,月底开放权重(42 条相关)→
「模型」频道最新
- EmbeddingGemma 2 禁用 FP16:激活超动态范围,会 NaN 或静默降质 — tomaarsen · 2026-10-07
- EmbeddingGemma 2 降维实测:128d 缩 6 倍但质量明显下降 — tomaarsen · 2026-10-07
- EmbeddingGemma 2 代码检索提升 14%,多语言小幅领先一代 — tomaarsen · 2026-10-07
- 让模型从零构建角色创建器:能跑通但仍需打磨 — flowersslop · 2026-10-07
- Google 收紧 Gemini 免费额度:10 月 9 日起免费用户仅剩 Flash Lite — stockduty77 · 2026-10-07
- Mistral Large 4 仅用 4000 块 GPU 训练,竞品 Astra 用了 10 万块 — steipete · 2026-10-07