Meta Muse Spark 1.3 对垒 Gemini 3.8 Flash:长上下文成绩碾压 GPT-5.6
ChrisGPT · x · 2026-09-03
博主 ChrisGPT 汇总了 Meta 新发布的 Muse Spark 1.3 与 Google 同日发布的 Gemini 3.8 Flash 的基准对比(数据引自 Google DeepMind,未经独立验证)。
- Muse Spark 1.3 在多项基准上胜出:GDPVal-AA v2 1754 vs 1545、DeepSWE 75.4 vs 73.7、OSWorld 2.0 66.9 vs 59.0;Gemini 仅在 Terminal-Bench 2.1 小幅领先(89.4 vs 88.8)。
- 长上下文最亮眼:Muse Spark 1.3 在 MRCR 256K–512K 达 98.5、512K–1M 达 98.1,而 GPT-5.6 Sol 分别为 91.5 和 73.8。
- 作者称其惊讶点在于该模型在 DeepSWE 和 Terminal-Bench 上胜过 Opus 5,但 Opus 在 GDPVal 和 OSWorld 上仍是强者。
「模型」频道最新
- GLM 5.3 与 5.3 Flash 上线 Together Chat,免配置免费试用 — oilmutt · 2026-09-03
- LatchBio 评测发现 Grok 拒答多来自模型自身,竞品靠外层拦截 — kenbwork · 2026-09-03
- 曝 Gemini 3.8 Flash 刷榜过拟合,第三方基准反超 3.7 — bindureddy · 2026-09-03
- Gemini 3.8 Flash 用户满意度双位数提升,可操控性更强 — tokumin · 2026-09-03
- Muse Spark 1.3 冲上榜单第三,首次插入 Claude 与 GPT 之间 — alexandr_wang · 2026-09-03
- Google 研究员调侃 Astra 不展示思考 token 争议:被制造出的焦虑 — rao2z · 2026-09-03