Muse Spark 1.1医疗基准领先

Daisy4ai · x · 2026-07-14

在 HealthBench Pro(OpenAI 的 525 个真实临床任务基准)上,Muse Spark 1.1 的表现与 GPT-5.6 Sol 接近,整体分数甚至略高。

原帖强调它在长度调整后的分数上与 GPT-5.6 Sol 基本打平,但推理成本更低:输入/输出每百万 token 约为 $1.25/$4.25,而 GPT-5.6 Sol 为 $5/$30,输出侧大约便宜 7 倍。作者把“可负担的医疗超级智能”作为目标。

所属事件:Meta Muse Spark 1.1 多项评测出炉,医疗与 Agent 表现亮眼(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →