Meta Muse Spark 1.1 多项评测出炉,医疗与 Agent 表现亮眼
7 月中旬,Meta 的 Muse Spark 1.1 模型集中公布了多项基准测试成绩与实测反馈。数据显示,该模型在医疗健康和通用 Agent 任务上均展现出极强的竞争力,引发了 AI 社区的广泛关注。
关键成绩
在医疗评测 HealthBench Professional(包含 525 个真实临床任务)中,Muse Spark 1.1 的总分超越了 GPT-5.6 Sol,被称为该基准上的 SOTA 模型。虽然其长度调整后的分数与 GPT-5.6 Sol 统计上十分接近,但整体表现依然实现了领先。在 Artificial Analysis 公布的 agentic knowledge work 基准 AA-Briefcase 中,Muse Spark 1.1 取得 863 分,整体表现与 Gemini 3.5 Flash 持平。此外,在 Agent Arena 新榜单里,该模型位列第 17 名,排在 Gemini 3.1 Pro 和 Qwen-3.7 Plus 之上,但低于 Grok 4.5。
实测与外部评价
除了跑分,该模型在实际测试中也获得了较高评价。@WorldofAI 在视频实测中称其为今年最被低估的模型之一,指出它在编码、网页应用生成等测试中超越了 Opus 4.8 和 Grok 4.5。在专业领域,@jackwrae 转述的用户反馈与 RadLE-H 相关测试结果指出,Muse Spark 1.1 在健康、放射学等话题上表现极为出色,相关能力被认为已接近人类专家水平。
2026-07-14 ~ 2026-07-15 · 7 条相关
- 第 1 集:Meta超级智能实验室:Muse Spark更新及Opus级高性能变体即将发布(2026-07-03,2 条)
- 第 2 集:Meta发布Muse Spark 1.1,主打低成本与强Agentic能力(2026-07-09,133 条)
- 第 3 集:Meta Muse Spark 1.1多基准评测亮眼,智能与编码能力大幅提升(2026-07-09,15 条)
- 第 4 集:Meta Muse Spark 1.1 多项榜单成绩亮眼(2026-07-11,13 条)
- 第 5 集:Meta Muse Spark 1.1 多项评测出炉,医疗与 Agent 表现亮眼(2026-07-14,7 条)
- 第 6 集:Meta发布Muse Spark 1.1并开放API(2026-07-15,2 条)
一手来源
- Muse Spark 1.1 医疗基准领先 — alexandr_wang ·
- Muse Spark 1.1 基准成绩公布 — ArtificialAnlys ·
- Muse Spark 1.1 跑分第17 — arena ·
- Muse Spark 1.1 在健康领域表现优异 — jack_w_rae · 2026-07-14
- 【源头】Muse Spark 1.1 基准成绩公布 — ArtificialAnlys · 2026-07-14
- 【源头】Muse Spark 1.1 医疗基准领先 — alexandr_wang · 2026-07-14
- Meta Muse Spark 1.1 实测 — WorldofAI · 2026-07-14
- Meta模型在医疗评测中登顶 — Scobleizer · 2026-07-14
- 【源头】Muse Spark 1.1 跑分第17 — arena · 2026-07-15
另有 1 条近重复转述:Daisy4ai