专题 · FULL STORY

Meta 发布 Muse Spark 1.3:评测与市场反应

9月3日Meta正式发布Muse Spark 1.3,即日在Muse Code与API上线,官方宣称编码与智能体能力大幅提升。第三方评测显示其智能指数达62分逼近头部模型,成本效率同档最低,但Polymarket上其登顶赌局赔率仅12%。

2026-09-03 ~ 2026-09-03 · 3 集 · 36 条

第 1 集 · Meta 发布 Muse Spark 1.3,编码与智能体能力大幅提升(2026-09-03,27 条)

9 月 3 日,Meta 正式发布 Muse Spark 1.3,并即日在 Muse Code 与 Meta 模型 API 上线。官方与 Meta 高管 Alexandr Wang 将其定位为 Spark 系列迄今最强的模型,重点强化智能体(agentic)与编码任务的真实可用性。多位团队成员(renhongyu、Edward Sun 等)补充,这是两个月内从 1.1 到 1.3 的连续第三次升级;m18 转述的 Alexandr Wang 帖则称这是五个月内的第四个 Muse Spark 版本,团队重点推进编码、Agent、指令遵循与长上下文能力。

已确认

  • 模型已上线 Muse Code 与 Meta Model API,当日起可用;max reasoning 档位将在完成安全测试后推出,m18 提及 Muse Spark 1.3 (max) 已限量预览,据 Artificial Analysis 智能指数为 62
  • 支持在同一线程中跨多个工作流完成更长链条的长时程任务,主打复杂指令遵循,并降低 Agent 任务中的幻觉
  • 交互更主动协作:会追问澄清、标注卡住状态、关键操作前确认
  • 对比 1.2 版本:浪费的轮次更少,工具调用减少约 20%,token 消耗减少约 25%
  • m1 给出具体定价:每百万 token 输入 0.10 美元、输出 0.20 美元,模型页面已在 Meta 开发者网站上架;m18 转述称价格约为 Claude 的 1/125
  • 官方账号(AIatMeta)在发布串中预告后续将推出更大的模型(转发帖提及代号 🍉 Watermelon)及 Muse Spark 开放权重(open weights),具体时间未公布
  • m14 转述的高管访谈提及方法论:通过增加评分(rating)算力来治理模型的「懒惰」与讨好行为
  • m4 提及第三方 aimlapi 做了 1.2 与 1.3 的单次生成对比(用单个 HTML 文件生成三件收藏级 3D 维京主题手办),属第三方体验,非官方基准

尚未确认

  • 「性能对标 Fable 5」「Watermelon 将达到更高规模」等说法来自转述帖的分析,官方未在给出材料中直接确认;开放权重与新模型的具体时间表未公布

为什么重要

此次升级的核心叙事是从单轮能力转向长程智能体工作流的实用性:更少的工具调用与 token 消耗意味着智能体任务的实际成本与延迟下降,而 0.10/0.20 美元的定价进一步压低使用门槛。两个月三次(或五个月四次,依口径不同)迭代的节奏,加上开放权重与更大模型的预告,显示 Meta 在编码与 Agent 赛道明显提速,是模型厂商竞争重心转向 agent 场景与价格战的又一信号。

还有 7 条相关讨论 →

第 2 集 · Meta 发布最强模型 Muse Spark 1.3,登顶赌局赔率仅 12%(2026-09-03,2 条)

据 Polymarket 快讯,Meta 发布其迄今最强 AI 模型 Muse Spark 1.3,AI 负责人 Alexandr Wang 宣称该模型编码能力超越 GPT-5.6 Sol。然而在 Polymarket「谁将在 12 月 31 日前拥有排名第一的 AI 模型」市场上,Meta 的赔率仅为 12%,显示市场对其登顶仍持谨慎态度。

第 3 集 · Meta 发布 Muse Spark 1.3:智能指数 62 分逼近头部,成本效率同档最低(2026-09-03,7 条)

Meta 于 9 月 3 日发布专有推理模型 Muse Spark 1.3,这是五个月内的第四次迭代。Artificial Analysis 已上线其评测页面:max 版智能指数 62 分、xhigh 版 61 分,较 1.1 的 53 和 1.2 的 57 连续大幅跳升,远高于同类模型中位数 17,在全部 636 款模型中位居前列。按 alexandrwang 的转述,该分数与 Claude Fable 5 持平并超过 GPT-5.6 Sol、Grok 4.6、Kimi K3 和 Gemini,而价格仅约其八分之一;Reddit 用户据此认为 Meta 正在慢慢追回与头部模型的差距。

已确认

  • Artificial Analysis 智能指数:xhigh 版 61 分、max 版 62 分,与 GPT-5.6 Sol (max) 接近
  • 模型为专有推理模型,支持 1M tokens 上下文窗口
  • 定价维持 $1.25/$4.25 每百万 token,xhigh 版每个智能指数任务成本仅 $0.55,是其智能水平上成本效率最高的模型
  • Tau3-Bench Banking:max 版得 52% 成为该评测新第一;xhigh 版 47%,与 Claude Fable 5.1 (max) 等相当
  • 相对 1.2 的提升集中在 agentic 评测,如 GDPval-AA v2 有明显涨幅

为什么重要

  • 五个月连发四款的节奏叠加智能指数连续跳升,显示 Meta 在快速缩小与头部模型的差距
  • 在同等智能水平下做到同档最低任务成本,对按量付费的 Agent 应用场景有直接吸引力
  • Agent 类评测(GDPval-AA v2、Tau3-Bench Banking)成为本轮提升的主要来源,表明迭代方向聚焦智能体能力