独立复现拆穿 Mistral Large 4「熔岩灯」翻车:Opus 系列同样做不出
qtnx_ · x · 2026-10-07
法国开发者 rbenll 对病毒式传播的 Mistral Large 4「熔岩灯测试」失败案例做了独立复核。他怀疑原测试有偏见甚至故意贬低 Mistral,于是用同一 prompt 各跑三次,对比 Mistral 与 2026 年所有已发布的 Opus。
结果:
- Mistral 确实做不出熔岩,但能做出一盏真正的灯,而非原帖声称的「烧坏的灯泡」——同模型同 prompt,两次结果不同。
- Opus 4.7 和 Opus 5 同样做不出熔岩,一无所出。
结论是这个测试本身就在「拿不可比的东西作比较」,不需要作弊模型也会失败;作者自称这是以荒谬方式 debunk 该基准。qtnx 转发作为「别信末日论」的又一例证。
所属事件:Mistral Large 4 翻车潮反转:多数案例没开 reasoning 参数(4 条相关)→
「Fun」频道最新
- 本·阿弗莱克自曝会写 Python,还借明星身份看过 OpenAI 视频模型 — david_perell · 2026-10-07
- AI 都能做数学证明了,OpenAI 的 Seb Bubeck 该拿几个菲尔兹奖? — __nmca__ · 2026-10-07
- 用 Claude + huashu-art-motion 自制马里奥风格关卡,连道具都在问 AI 订阅 — AlchainHust · 2026-10-07
- 网友用 Claude 把 58 页数学证明变成 2 分钟 3D 动画讲解 — imjustnewatai · 2026-10-07
- Mistral Large 4 群聊 onboarding 演示截图引围观 — liminal_bardo · 2026-10-07
- AI 模型号称达成「Celeryman 完备」,16 年研究迎来搞笑落地 — turtlesoupy · 2026-10-07