Muse Spark 1.3 智能指数大涨,Agent 类评测提升最明显
ArtificialAnlys · x · 2026-09-03
Artificial Analysis 公布 Muse Spark 1.3(xhigh 与 max)相对 1.2 的 Intelligence Index 变化:提升集中在 agentic 评测——GDPval-AA v2 分别 +94 和 +139 Elo(1615→1709/1754),Terminal-Bench 2.1 达 85%/86%(+5/+6 分),Tau3-Bench Banking 从 35% 升至 47%/52%。
小幅回退方面:两款模型 AA-LCR 均下降 4 分(83%→79%),AA-Omniscience 准确率 xhigh -3 分(45%→42%)、max -1 分(45%→44%)。
成本效率:xhigh 在同智能档位最省——每任务 $0.55(定价维持 $1.25/$4.25 每百万 token),低于 Gemini 3.8 Flash($0.58)、GPT-5.6 Sol($0.63)、GLM-5.3($0.68)等,而同为 61 分的 Grok 4.6 要 $0.94。
所属事件:Meta 发布 Muse Spark 1.3:智能指数 61-62,成本效率与 Agent 评测领先(6 条相关)→
「模型」频道最新
- GPT-5.6 与 Claude 生成太慢,作者呼唤扩散式编码模型 — viksit · 2026-09-03
- 曝 Meta Muse Spark 1.3 发布数小时即以 62 分反超 Gemini 3.8 Flash — AIatMeta · 2026-09-03
- Domingos:当今基准测试如同测没有车手的 F1 赛车 — pmddomingos · 2026-09-03
- 研究者吐槽 LLM 文档滥用习语:一小时读不完几页文档 — ZeeshanZiaML · 2026-09-03
- Fable 5.1 答一个问题耗 66.8 万 token,闭源无法查账 — joshalbrecht · 2026-09-03
- Gemini 3.8 帕累托前沿位置仅保住 3.5 小时即被超越 — giffmana · 2026-09-03