Muse Spark 1.1 跑分第17
arena · x · 2026-07-15
Agent Arena 公布了新的排行榜与评测说明。Meta 的 Muse Spark 1.1 排名第 17,位于 Gemini 3.1 Pro 和 Qwen-3.7 Plus 之上,但低于 Grok 4.5 和 GLM 5.2。
该榜单来自 Agent Arena:他们用全球用户提交的数百万个真实长链路 agent 任务来衡量模型表现。模型可以调用 网页搜索、文件系统和终端 等工具完成复杂工作流,排名依据的是任务结果相对平均模型的表现,并采用因果追踪方法进行测量。
所属事件:Meta Muse Spark 1.1 多项评测出炉,医疗与 Agent 表现亮眼(7 条相关)→
「模型」频道最新
- 反事实推演:若无推理范式,今天模型可能才刚到 o3 水平 — Jsevillamol · 2026-09-03
- Fable 5.1 距饱和 ARC-AGI-2 仅差 10%,每任务成本再降 32% — rohanpaul_ai · 2026-09-03
- 实测 LLM 谈判合同、批改代码:一家团队的四类真实用法 — xuanalogue · 2026-09-03
- 团队称其视频模型 h3 max 居各独立评测榜第一 — isidentical · 2026-09-03
- Meta SAM 3 登上 Hugging Face 趋势榜,主打图像与视频分割 — facebook · 2026-09-03
- Anthropic 内部「养老院」环境曝光:历代 Claude 互相对话 — repligate · 2026-09-03