Mistral Large 4 实测 STEMBench 表现亮眼
GuillaumeLample · x · 2026-10-07
Guillaume Lample 转发了 STEMBench 作者 przchojecki 的评测:Mistral Large 4 在覆盖 6 个领域、每个领域 20 题的 STEMBench 测试中取得了不错的成绩,展现出跨领域开展原创研究的能力,且各领域表现均衡,被称为「欧洲 AI 的一大胜利」。
「模型」频道最新
- 反驳质疑:AI 数学答案不在字典里,人类专家也没能解出 — aran_nayebi · 2026-10-07
- 研究称 ChatGPT 与 Claude 判定顾客富裕时推荐更贵商品 — Polymarket · 2026-10-07
- 用户实测:$20 月费 AI 订阅依然够用,只在 5 小时限额时切换 — tristanbob · 2026-10-07
- 用户抱怨 macOS 27 禁用 Siri 后仍强制占用 30GB 苹果 AI 模型 — busymom0 · 2026-10-07
- Claude Opus 5.5 按公开数据生成 600 零件涡扇发动机并可模拟气流 — bookwormengr · 2026-10-07
- 传 OpenAI 数学成果只是第一批,后面还有两批待发 — socoolandawesome · 2026-10-07