Mistral 118B模型评测引争议,官方开源全部评测轨迹自证实力
ZainHasan6 · x · 2026-07-22
针对近期发布的 Mistral 118B 模型超出预期的高分评测,社区出现了质疑声音。原作者发推表示,官方为了证明成绩的真实性与模型实力,已将所有评测背后的轨迹(eval trajectories)完全公开,邀请大众自行查阅验证,不再仅仅要求用户“盲信”分数。
「模型」频道最新
- Opus 3 和 Sonnet 3 上演了一场荒诞跨界对话 — repligate · 2026-07-27
- Kimi K3 登陆 Together,预留吞吐成本低 65% — togethercompute · 2026-07-27
- OpenAI 可能撞上算力上限,Codex 和 ChatGPT Work 四个月涨到 1000 万 — JoshuaJBouw · 2026-07-27
- Gemma 在开放权重生态里还需要更大的基础模型 — _xjdr · 2026-07-27
- Repligate:Claude Opus 3 权重不变却像在持续演化 — repligate · 2026-07-27
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27