Mistral Large 4 榜单落后 GLM-5.3,Yuchen 调侃「评测危机」
Yuchenj_UW · x · 2026-10-06
AI 研究者 Yuchen Jin 指出,Mistral 刚发布的 Mistral Large 4(绰号 Le Chonk)在 Artificial Analysis Intelligence Index 上明显落后于 GLM-5.3,甚至不及 GLM-5.3 Flash。他借此调侃当前评测基准乱象,称「我们正处于 Eval 危机中」——不同榜单结果与各家宣传口径差异巨大,模型真实能力越来越难判断。
「Fun」频道最新
- 博主吐槽新模型发布将被 Qwen 4 27B 碾压,小 8 倍性能反超 — gnukeith · 2026-10-06
- 1999 年骑自行车的 10 岁小孩:错过英伟达股票的梗图 — _jaydeepkarale · 2026-10-06
- 养孩子是并行跑多个 Agent 的最佳训练 — josh_wills · 2026-10-06
- Shazam 十几年前如何做到听歌识曲:频谱峰值+哈希表查找 — deedydas · 2026-10-06
- AI 估算需 5-8 周的工程量,开发者带子 Agent 两天干完 — Dan_Jeffries1 · 2026-10-06
- 「除了写代码你还干嘛?」程序员的自我调侃梗图 — letandrewcook · 2026-10-06