Muse Spark 1.3 拿下 Tau3-Bench Banking 第一:52%
ArtificialAnlys · x · 2026-09-03
Artificial Analysis 补充数据:Muse Spark 1.3 (max) 在 Tau3-Bench Banking 得 52%,成为该评测新第一;xhigh 版 47%,与 Claude Fable 5.1 (max) 和 GLM-5.3-Flash 持平,但仍低于 Qwen3.8 Max (51%)、Grok 4.6 (high, 51%) 和 GLM-5.3 (max, 50%)。
相比上月 Muse Spark 1.2 的 35%,这次跳升是两个版本智能指数总分提升的最大单一驱动因素。
所属事件:Meta 发布 Muse Spark 1.3:智能指数 61-62,成本效率与 Agent 评测领先(7 条相关)→
「模型」频道最新
- Fable 5.1 横评八款模型:编码到数据可视化,单次成本 0 到 65 美元 — arena · 2026-09-03
- 128GB 统一内存新选择:Qwen3.8-Flash-Next 或成最强开源模型 — victormustar · 2026-09-03
- GPT-5.6 与 Claude 生成太慢,作者呼唤扩散式编码模型 — viksit · 2026-09-03
- 曝 Meta Muse Spark 1.3 发布数小时即以 62 分反超 Gemini 3.8 Flash — AIatMeta · 2026-09-03
- Domingos:当今基准测试如同测没有车手的 F1 赛车 — pmddomingos · 2026-09-03
- 研究者吐槽 LLM 文档滥用习语:一小时读不完几页文档 — ZeeshanZiaML · 2026-09-03