Meta 五个月连发四款:Muse Spark 1.3 智能指数升至 61-62 分
ArtificialAnlys · x · 2026-09-03
Meta 发布 Muse Spark 1.3,这是五个月内的第四次迭代。Artificial Analysis 智能指数上,xhigh 版得 61 分(较 1.2 的 57、1.1 的 53 连续跳升),与 GPT-5.6 Sol (max)、Grok 4.6 (high) 持平;仅限合作伙伴预览的 max 版得 62 分,仅次于 Claude Fable 5.1 和 Claude Opus 5。
关键要点:
- 智能体能力是主要增益来源:Tau3-Bench Banking 从 35%→47%(xhigh)/52%(max,全场第一),Terminal-Bench 2.1 达 85-86%,GDPval-AA v2 Elo 涨 94-139 分。max 版靠更多推理轮次与 token 换来更高分。
- 性价比最优:xhigh 版每个智能指数任务成本 $0.55(定价维持 $1.25/$4.25 每百万 token),是 59 分以上模型中最低,比同分竞品便宜约 40%;但比 1.2 的 $0.55→$0.40 有所上升,因智能体评测输入 token 增约 57%。
- 科学推理普涨:CritPt +8 分至 26%,GPQA Diamond +4 至 94%。
所属事件:Meta 发布 Muse Spark 1.3:智能指数 61-62,成本效率与 Agent 评测领先(7 条相关)→
「模型」频道最新
- GLM-5.3 在 Databricks 推理达 310 tok/s,称最强开源编码模型 — jeremyphoward · 2026-09-03
- Fable 5.1 横评八款模型:编码到数据可视化,单次成本 0 到 65 美元 — arena · 2026-09-03
- Databricks:GLM-5.3 达 310 tok/s,自称最强开源编码模型 — DavidSKrueger · 2026-09-03
- 128GB 统一内存新选择:Qwen3.8-Flash-Next 或成最强开源模型 — victormustar · 2026-09-03
- GPT-5.6 与 Claude 生成太慢,作者呼唤扩散式编码模型 — viksit · 2026-09-03
- 曝 Meta Muse Spark 1.3 发布数小时即以 62 分反超 Gemini 3.8 Flash — AIatMeta · 2026-09-03