Meta Muse Spark 1.1多基准评测亮眼,智能与编码能力大幅提升

Meta 推出的原生多模态推理模型 Muse Spark 1.1 近期引发广泛关注。Artificial Analysis 发布的深度评测显示,该模型在多项核心能力上实现大幅跨越,不仅智能水平显著提升,在 token 效率与成本控制上也具备极强竞争力。

核心评测数据与能力提升

根据 Artificial Analysis 的评测,Muse Spark 1.1 的 Intelligence Index 达到 51 分,较 1.0 版本提升 8 分。这主要得益于科学推理、编程和知识能力的全面增强。在具体基准测试中,其 SciCode 取得 58% 的成绩(排名第三,仅次于 Claude Fable 5 和 Gemini 3.1),CyBench 得分 92.9%(接近 Claude Opus 4.6 的 93%)。此外,在 Coding Agent Index(基于 Opencode harness)中得分 69 分,略低于 GPT 系列但位居前列。值得注意的是,该模型智能排名的上升主要归功于幻觉率的降低,这与 Grok 4.5 准确率与幻觉率双升的模式截然不同。

计算机使用与实测反馈

Muse Spark 1.1 在计算机使用(Computer Use)方面被评价为“非常强”。实测反馈指出,该模型擅长前端生成与整体产出,用它进行“vibe-code”会有惊喜。不过也有用户指出其存在细节短板,例如在覆盖文件前未先检查是否已存在。总体而言,业界认为它在很多任务上已经“够用”,且速度极快。

成本与效率优势

除了能力提升,Muse Spark 1.1 的 token 效率与成本控制表现亮眼。跑完整个 Intelligence Index 仅消耗 9400 万输出 tokens,远低于同档位其他模型。其实际运行效率被认为高于 Kimi K2.6 或 GLM 5.2,填补了高性能与低成本之间的市场空缺。

2026-07-09 ~ 2026-07-11 · 15 条相关

事件全程(共 6 集)→

一手来源

另有 1 条近重复转述:shuchaobi