开源 Baba Is You 基准重测 Claude Opus 5 等四款模型
pmigdal · reddit · 2026-07-29
作者把自己维护的开源 Baba Is You 基准重新跑了一遍,测试对象包括 Claude Opus 5、Kimi K3、Grok 4.5、Gemini 3.6 Flash。
这条帖子的核心不是单纯报新模型,而是通过同一套游戏基准来比较不同模型的表现与成本,甚至直接抛出两个问题:Claude Opus 5 是否比 Fable 5 更便宜,以及哪一个模型的实际使用成本最高。
「模型」频道最新
- 用户改口称 GPT 5.6 Sol 其实是个很强的模型 — TheZachMueller · 2026-07-29
- Sam Altman 预告 GPT-5.6 Sol 7 月上 Cerebras,750 token/s — daniel_mac8 · 2026-07-29
- Grok 4.5 在 LaurenBench 以 56.9% 登顶,领先 Claude Sonnet 5 和 GLM 5.2 — elonmusk · 2026-07-29
- 一张爆图对比 12 类付费 AI 工具与免费替代品 — nikola_mr64990 · 2026-07-29
- Verdent 携手月之暗面,为 2.8T 参数 Kimi K3 优化编程工作流 — PrajwalTomar_ · 2026-07-29
- 120B 参数内最强本地模型求推荐:Qwen 系列仍是唯一解? — Possible_Grocery8079 · 2026-07-29