Mistral Large 4 实测宣称:DeepSWE 超 GLM 5.3,Tbench 4 胜 Kimi k3
b_roziere · x · 2026-10-06
Mistral 团队继续介绍 Mistral Large 4(Chonky)的评测表现:
- 官方强调基准不代表全部,重点在实际使用场景,并称其为「世界最好的开源模型」
- 代码 agent 基准上:DeepSWE 超过 GLM 5.3,Tbench 4 超过 Kimi k3
- 模型已在预览 API 开放试用,详情见官方博客
所属事件:Mistral 发布 1T 参数开源模型 Large 4(38 条相关)→
「编程与Agent」频道最新
- PE 被投企业 AI 落地实战:20+ 命令工具包与自动化审查 agent — alex_verem · 2026-10-06
- 谁来监督 AI?答案是另一个 AI:企业 agent 治理将分层化 — shaunralston · 2026-10-06
- Autonomous Lamp 开源桌面伴侣机器人开卖:$499 搭 Jev 分层大脑 — dee_hw · 2026-10-06
- invideo 推出 MCP:接 250+ 模型搞定文生视频全流程 — aziz4ai · 2026-10-06
- Harvey 换 harness 后 7 模型均分 23.3%→62.4%,成本还降 60% — rajistics · 2026-10-06
- 同款模型换 harness 提分 23%→62%,作者称性能瓶颈不在模型 — rajistics · 2026-10-06