Meta Muse Spark 1.1 多项评测出炉,医疗与 Agent 表现亮眼

7 月中旬,Meta 的 Muse Spark 1.1 模型集中公布了多项基准测试成绩与实测反馈。数据显示,该模型在医疗健康和通用 Agent 任务上均展现出极强的竞争力,引发了 AI 社区的广泛关注。

关键成绩

在医疗评测 HealthBench Professional(包含 525 个真实临床任务)中,Muse Spark 1.1 的总分超越了 GPT-5.6 Sol,被称为该基准上的 SOTA 模型。虽然其长度调整后的分数与 GPT-5.6 Sol 统计上十分接近,但整体表现依然实现了领先。在 Artificial Analysis 公布的 agentic knowledge work 基准 AA-Briefcase 中,Muse Spark 1.1 取得 863 分,整体表现与 Gemini 3.5 Flash 持平。此外,在 Agent Arena 新榜单里,该模型位列第 17 名,排在 Gemini 3.1 Pro 和 Qwen-3.7 Plus 之上,但低于 Grok 4.5。

实测与外部评价

除了跑分,该模型在实际测试中也获得了较高评价。@WorldofAI 在视频实测中称其为今年最被低估的模型之一,指出它在编码、网页应用生成等测试中超越了 Opus 4.8 和 Grok 4.5。在专业领域,@jackwrae 转述的用户反馈与 RadLE-H 相关测试结果指出,Muse Spark 1.1 在健康、放射学等话题上表现极为出色,相关能力被认为已接近人类专家水平。

2026-07-14 ~ 2026-07-15 · 7 条相关

事件全程(共 6 集)→

一手来源

另有 1 条近重复转述:Daisy4ai