Meta Muse Spark 1.1 多项榜单成绩亮眼

Meta 推出的 Muse Spark 1.1 模型在多项基准测试与实际体验中展现出强劲实力,凭借极高的性价比与逼近前沿模型的能力引发了广泛关注。

榜单成绩与核心能力

在文本与编码能力上,Muse Spark 1.1 取得了多项突破。根据 Arena 的评测数据,该模型在 Text Arena 中以 1494 分位列第 5 名,相比原版高出 7 分,成功进入 Pareto 前沿。在 15 个选取的类别中,它有 12 个类别表现提升,其中 Expert 能力从第 36 名升至第 15 名,指令遵循能力也显著增强。在 Code Arena 的前端榜单中,它排名第 9,并在 Data & Analytics 领域高居第 2。此外,@shuchaobi 转发的数据显示,该模型在 ProofBench 基准测试中的形式化数学得分从 17% 大幅跃升至 39%,同时在 Vals Index 排行榜位列第四,且是前十名中延迟最低、速度最快的模型。

性价比与业界反馈

Muse Spark 1.1 的极致性价比成为讨论热点。@alexandr Wang 指出其输出 token 价格比 Fable 便宜约 90%,综合成本约为 $3.5/M。Artificial Analysis 的评测显示,Muse Spark 1.1 (xhigh) 在 Coding Agent Index 中拿到 69 分,在 Opencode 测试环境下展现了极佳的成本效率。在实际体验方面,用户反馈其前端设计能力很强,agentic 能力不俗。在相同提示词下,其输出被认为更精致、交互性更强,整体表现接近 ChatGPT Sol Medium、Claude Opus 4.8 以及 Grok 4.5。有观点认为,鉴于 Grok 4.5 和 Muse 的效果都已接近顶级,如果 Anthropic 未来将 Fable 从订阅中移除将会处于劣势。此外,还有基准汇总称其在 SciCode 上的表现领先 GPT-5.6,得分 58%。

2026-07-11 ~ 2026-07-12 · 13 条相关

事件全程(共 6 集)→

一手来源