Mistral Large 4 栽在魔方测试上,Matthew Berman 实测翻车
Matthew Berman · youtube · 2026-10-08
AI 评测博主 Matthew Berman 发布视频,称 Mistral Large 4 没能通过他的「魔方测试」——一个用于检验模型推理与规划能力的自设基准。视频展示了模型在该测试中的具体失败表现,是新旗舰模型能力实测的一个负面数据点。
「模型」频道最新
- 用户实测:Claude 3 Opus 可用 Max 订阅的月度 API 额度调用 — repligate · 2026-10-09
- 爆料:Grok 语音模式即将登陆 X,点麦克风即可开口对话 — nima_owji · 2026-10-09
- 订阅价不变后 Claude 思考 token 暴跌?五种测量方式实锤缩水 — _AustinCalvert_ · 2026-10-09
- GPT-6 被评为最强 AI 写手:自然度大跳级几乎免改稿 — VraserX · 2026-10-09
- 用户实测:GPT-6 疑似无法直接读写已保存记忆 — ItsAGarbageAccount · 2026-10-09
- 不生成文本的模型 Jev 实测:精度追平 GPT-6 Astra,成本仅 1/500 — JenniferHli · 2026-10-09