专题 · FULL STORY
Meta Muse Spark 1.1:从预热到实测全景
事件起于Meta新模型预热,随后Muse Spark 1.1正式发布并开放API。该模型凭借低成本与强Agent能力引发热议,后续多维度评测均证实其编码与医疗等任务表现亮眼。
2026-07-03 ~ 2026-07-15 · 6 集 · 172 条
第 1 集 · Meta超级智能实验室:Muse Spark更新及Opus级高性能变体即将发布(2026-07-03,2 条)
- Meta仍在训练旗舰大模型,Muse Spark进展更新即将公布 — scaling01 · 2026-07-03
- Meta超级智能实验室:Muse Spark更新及Opus级高性能变体即将发布 — Scobleizer · 2026-07-03
第 2 集 · Meta发布Muse Spark 1.1,主打低成本与强Agentic能力(2026-07-09,133 条)
7月9日,Meta官方正式发布多模态推理模型Muse Spark 1.1(早期名Hornbill)。作为首个版本的升级,该模型主打在低价格下的强大智能体与编码能力,标志着Meta重新回到前沿AI竞争中。目前,模型已通过进入公测的Meta Model API向开发者开放,也可在Meta AI中使用。
核心能力与技术细节
Muse Spark 1.1支持100万token上下文,并能自行压缩历史记录以保留关键步骤。官方强调其在工具使用、电脑操作、编码和多模态理解上的提升,能够零样本泛化到新工具,规划跨应用任务并分派给并行子智能体。此外,它能在多应用流程中保持上下文,自动切换脚本与界面操作,并处理视觉和音频输入。
评测表现与各方反应
Alexandr Wang转述称,该模型在MCP Atlas、Humanity’s Last Exam等评测中表现强劲,在Harvey Legal Bench等基准上达到SOTA,整体agentic能力可与GPT-5.5和Opus-4.8相提并论,甚至在部分分布外评测中超越Opus 4.8和Grok 4.5。Garry Tan和Alexandr Wang均表示该模型在OpenClaw(机器人/机械臂场景)实测中效果优异。Bindu Reddy等业界人士也对其benchmark表现及API开放给予正面评价。
内部应用与生态支持
Meta透露,Muse Spark 1.1已用于公司内部编码和研究工作流,帮助自动化模型开发与评估。外部生态方面,Replit、Box等早期试用伙伴已开始基于其API进行开发。
- Meta 发布 Muse Spark 1.1 — AIatMeta · 2026-07-09
- Muse Spark 1.1 评测表现曝光 — alexandr_wang · 2026-07-09
- Muse Spark 1.1 强化 Agent 执行 — alexandr_wang · 2026-07-09
- Muse Spark 1.1 支持电脑操作 — alexandr_wang · 2026-07-09
- Muse Spark 1.1 编程能力提升 — alexandr_wang · 2026-07-09
- Meta API进入公测 — alexandr_wang · 2026-07-09
- Meta Model API 开放预览 — alexandr_wang · 2026-07-09
- Meta发布Muse Spark 1.1 — shengjia_zhao · 2026-07-09
- Muse 系列与 API 有新进展 — alexandr_wang · 2026-07-09
- Meta 发布 Muse Spark 1.1 — RihardJarc · 2026-07-09
- Muse Spark 1.1 升级上线 — shengjia_zhao · 2026-07-09
- Meta发布Muse Spark 1.1 — AIatMeta · 2026-07-09
- Muse Spark 1.1强化多智能体能力 — AIatMeta · 2026-07-09
- Muse Spark 1.1可处理多模态电脑任务 — AIatMeta · 2026-07-09
- Meta称Muse Spark 1.1用于内部工作流 — AIatMeta · 2026-07-09
- Muse Spark 1.1提升编码与电脑操作 — AIatMeta · 2026-07-09
- Meta 发布 Muse Spark 1.1 — EverydayAI_ · 2026-07-09
- Muse Spark 1.1 编程能力接近 GLM5.2 — zephyr_z9 · 2026-07-09
- Muse Spark 1.1跻身前沿模型行列 — inductionheads · 2026-07-09
- Meta 推出 Muse Spark 1.1 — haider1 · 2026-07-09
第 3 集 · Meta Muse Spark 1.1多基准评测亮眼,智能与编码能力大幅提升(2026-07-09,15 条)
Meta 推出的原生多模态推理模型 Muse Spark 1.1 近期引发广泛关注。Artificial Analysis 发布的深度评测显示,该模型在多项核心能力上实现大幅跨越,不仅智能水平显著提升,在 token 效率与成本控制上也具备极强竞争力。
核心评测数据与能力提升
根据 Artificial Analysis 的评测,Muse Spark 1.1 的 Intelligence Index 达到 51 分,较 1.0 版本提升 8 分。这主要得益于科学推理、编程和知识能力的全面增强。在具体基准测试中,其 SciCode 取得 58% 的成绩(排名第三,仅次于 Claude Fable 5 和 Gemini 3.1),CyBench 得分 92.9%(接近 Claude Opus 4.6 的 93%)。此外,在 Coding Agent Index(基于 Opencode harness)中得分 69 分,略低于 GPT 系列但位居前列。值得注意的是,该模型智能排名的上升主要归功于幻觉率的降低,这与 Grok 4.5 准确率与幻觉率双升的模式截然不同。
计算机使用与实测反馈
Muse Spark 1.1 在计算机使用(Computer Use)方面被评价为“非常强”。实测反馈指出,该模型擅长前端生成与整体产出,用它进行“vibe-code”会有惊喜。不过也有用户指出其存在细节短板,例如在覆盖文件前未先检查是否已存在。总体而言,业界认为它在很多任务上已经“够用”,且速度极快。
成本与效率优势
除了能力提升,Muse Spark 1.1 的 token 效率与成本控制表现亮眼。跑完整个 Intelligence Index 仅消耗 9400 万输出 tokens,远低于同档位其他模型。其实际运行效率被认为高于 Kimi K2.6 或 GLM 5.2,填补了高性能与低成本之间的市场空缺。
- Muse Spark 1.1 接近顶级分 — scaling01 · 2026-07-09
- Muse Spark 1.1 编码能力再获好评 — alexandr_wang · 2026-07-10
- Muse Spark 1.1 实测反馈不错 — BenBajarin · 2026-07-10
- Meta Muse Spark 1.1 评测发布 — ArtificialAnlys · 2026-07-11
- Muse Spark 1.1 评测上升8分 — ArtificialAnlys · 2026-07-11
- Muse Spark 1.1 基准表现亮眼 — ArtificialAnlys · 2026-07-11
- Muse Spark 1.1 成本更低 — ArtificialAnlys · 2026-07-11
- Muse Spark 1.1 智商排名上升靠的是降低幻觉 — ArtificialAnlys · 2026-07-11
- Muse Spark 1.1 幻觉率下降 — ArtificialAnlys · 2026-07-11
- Muse Spark 1.1 评测结果 — elemental-mind · 2026-07-11
- Muse Spark 1.1 编程能力显著提升 — EdwardSun0909 · 2026-07-11
- Muse Spark 1.1计算机使用增强 — alexandr_wang · 2026-07-11
- Muse Spark 1.1 编码 Agent 评测靠前 — ArtificialAnlys · 2026-07-11
- Muse Spark 1.1编码Agent评测 — shuchaobi · 2026-07-11
- Meta Muse Spark 1.1 实测评价 — alexandr_wang · 2026-07-11
第 4 集 · Meta Muse Spark 1.1 多项榜单成绩亮眼(2026-07-11,13 条)
Meta 推出的 Muse Spark 1.1 模型在多项基准测试与实际体验中展现出强劲实力,凭借极高的性价比与逼近前沿模型的能力引发了广泛关注。
榜单成绩与核心能力
在文本与编码能力上,Muse Spark 1.1 取得了多项突破。根据 Arena 的评测数据,该模型在 Text Arena 中以 1494 分位列第 5 名,相比原版高出 7 分,成功进入 Pareto 前沿。在 15 个选取的类别中,它有 12 个类别表现提升,其中 Expert 能力从第 36 名升至第 15 名,指令遵循能力也显著增强。在 Code Arena 的前端榜单中,它排名第 9,并在 Data & Analytics 领域高居第 2。此外,@shuchaobi 转发的数据显示,该模型在 ProofBench 基准测试中的形式化数学得分从 17% 大幅跃升至 39%,同时在 Vals Index 排行榜位列第四,且是前十名中延迟最低、速度最快的模型。
性价比与业界反馈
Muse Spark 1.1 的极致性价比成为讨论热点。@alexandr Wang 指出其输出 token 价格比 Fable 便宜约 90%,综合成本约为 $3.5/M。Artificial Analysis 的评测显示,Muse Spark 1.1 (xhigh) 在 Coding Agent Index 中拿到 69 分,在 Opencode 测试环境下展现了极佳的成本效率。在实际体验方面,用户反馈其前端设计能力很强,agentic 能力不俗。在相同提示词下,其输出被认为更精致、交互性更强,整体表现接近 ChatGPT Sol Medium、Claude Opus 4.8 以及 Grok 4.5。有观点认为,鉴于 Grok 4.5 和 Muse 的效果都已接近顶级,如果 Anthropic 未来将 Fable 从订阅中移除将会处于劣势。此外,还有基准汇总称其在 SciCode 上的表现领先 GPT-5.6,得分 58%。
- Muse Spark 1.1形式化数学能力大幅提升 — shuchaobi · 2026-07-11
- Muse Spark 1.1 代码前端榜第九 — arena · 2026-07-11
- Muse Spark 1.1 文本榜升至第五 — arena · 2026-07-11
- Muse Spark 1.1 入选文本榜前沿 — arena · 2026-07-11
- Muse Spark 1.1 多项文本能力提升 — arena · 2026-07-11
- Muse Spark 1.1 榜单成绩提升 — arena · 2026-07-11
- Muse Spark 1.1 价格更低且支持编排 — alexandr_wang · 2026-07-11
- Muse Spark 1.1进前端榜单 — jffwng · 2026-07-11
- Muse Spark 1.1 体验与性价比对比 — alexandr_wang · 2026-07-12
- Muse Spark 1.1 评测接近顶级模型 — alexandr_wang · 2026-07-12
- Meta Muse Spark 实测更省钱 — alexandr_wang · 2026-07-12
- Muse Spark 1.1 编码评测69分 — ArtificialAnlys · 2026-07-12
- Muse Spark 1.1 基准分数曝光 — OfirPress · 2026-07-12
第 5 集 · Meta Muse Spark 1.1 多项评测出炉,医疗与 Agent 表现亮眼(2026-07-14,7 条)
7 月中旬,Meta 的 Muse Spark 1.1 模型集中公布了多项基准测试成绩与实测反馈。数据显示,该模型在医疗健康和通用 Agent 任务上均展现出极强的竞争力,引发了 AI 社区的广泛关注。
关键成绩
在医疗评测 HealthBench Professional(包含 525 个真实临床任务)中,Muse Spark 1.1 的总分超越了 GPT-5.6 Sol,被称为该基准上的 SOTA 模型。虽然其长度调整后的分数与 GPT-5.6 Sol 统计上十分接近,但整体表现依然实现了领先。在 Artificial Analysis 公布的 agentic knowledge work 基准 AA-Briefcase 中,Muse Spark 1.1 取得 863 分,整体表现与 Gemini 3.5 Flash 持平。此外,在 Agent Arena 新榜单里,该模型位列第 17 名,排在 Gemini 3.1 Pro 和 Qwen-3.7 Plus 之上,但低于 Grok 4.5。
实测与外部评价
除了跑分,该模型在实际测试中也获得了较高评价。@WorldofAI 在视频实测中称其为今年最被低估的模型之一,指出它在编码、网页应用生成等测试中超越了 Opus 4.8 和 Grok 4.5。在专业领域,@jackwrae 转述的用户反馈与 RadLE-H 相关测试结果指出,Muse Spark 1.1 在健康、放射学等话题上表现极为出色,相关能力被认为已接近人类专家水平。
- Muse Spark 1.1 在健康领域表现优异 — jack_w_rae · 2026-07-14
- Muse Spark 1.1 基准成绩公布 — ArtificialAnlys · 2026-07-14
- Muse Spark 1.1 医疗基准领先 — alexandr_wang · 2026-07-14
- Muse Spark 1.1医疗基准领先 — Daisy4ai · 2026-07-14
- Meta Muse Spark 1.1 实测 — WorldofAI · 2026-07-14
- Meta模型在医疗评测中登顶 — Scobleizer · 2026-07-14
- Muse Spark 1.1 跑分第17 — arena · 2026-07-15
第 6 集 · Meta发布Muse Spark 1.1并开放API(2026-07-15,2 条)
Meta 官方发布了 Muse Spark 1.1 模型,这是对其早期版本的重要升级,并已在 OpenClaw 中上线。该模型专为 agentic coding、工具调用和 computer-use 工作流设计,同时开放了 API,为开发者提供全新的智能体应用构建能力。
- Meta发布Muse Spark 1.1并开放API — spillai · 2026-07-15
- Meta 推出 Spark 1.1 — steipete · 2026-07-15