Muse Spark 1.1 基准成绩公布
ArtificialAnlys · x · 2026-07-14
Muse Spark 1.1 在新的 agentic knowledge work 基准 AA-Briefcase 上取得 863 分,整体与 Gemini 3.5 Flash 持平,并排在 NVIDIA Nemotron 3 Ultra 附近。
这套基准测试覆盖大量真实任务输入文件,要求模型产出表格、演示文稿和 UI mock-up,并用三部分综合评分:
- rubric pass rate:客观正确性检查
- analytical quality:分析质量
- presentation quality:呈现质量
结果显示,Muse Spark 1.1 的优势主要来自更强的任务完成度和分析质量;其 rubric pass rate 为 34.5%,高于 GPT-5.5 (xhigh),略低于 GLM 5.2 (max)。但它在呈现质量上较弱,Presentation Elo 仅 432,比上一版 Muse Spark 还低 67 分,也略低于 Mistral Medium 3.5。
所属事件:Meta Muse Spark 1.1 多项评测出炉,医疗与 Agent 表现亮眼(7 条相关)→
「模型」频道最新
- LlamaIndex 实测 Fable 5.1:文档 OCR 各项指标全面超越上代 — llama_index · 2026-09-03
- 反事实推演:若无推理范式,今天模型可能才刚到 o3 水平 — Jsevillamol · 2026-09-03
- Fable 5.1 距饱和 ARC-AGI-2 仅差 10%,每任务成本再降 32% — rohanpaul_ai · 2026-09-03
- 实测 LLM 谈判合同、批改代码:一家团队的四类真实用法 — xuanalogue · 2026-09-03
- 团队称其视频模型 h3 max 居各独立评测榜第一 — isidentical · 2026-09-03
- Meta SAM 3 登上 Hugging Face 趋势榜,主打图像与视频分割 — facebook · 2026-09-03