专题 · FULL STORY

Meta Muse Spark 1.3:发布与实测

Meta 于 9 月 3 日发布专有推理模型 Muse Spark 1.3,五个月内第四次迭代,智能指数 62 分逼近头部。模型同步登陆 Muse Code 与 API,随后开发者实测其自改进能力,Meta 首席 AI 官 Alexandr Wang 也转赞多智能体实测结果。

2026-09-03 ~ 2026-09-03 · 4 集 · 51 条

第 1 集 · Meta 发布 Muse Spark 1.3,智能指数逼近 Claude 头部模型(2026-09-03,44 条)

Meta 于 9 月 3 日发布专有推理模型 Muse Spark 1.3,这是五个月内的第四次迭代,已在 Muse Code 与 Meta Model API 上线,max reasoning 档位将在完成安全测试后推出。Artificial Analysis 智能指数显示:max 版 62 分、xhigh 版 61 分,较 1.1 的 53 和 1.2 的 57 连续大幅跳升,与 Claude Fable 5 持平并超过 GPT-5.6 Sol、Grok 4.6、Kimi K3 和 Gemini,而价格仅约其八分之一,显示 Meta 正在快速追回与头部模型的差距。

已确认

  • 官方(AIatMeta、Alexandr Wang)称 1.3 对比 1.2:工具调用减少约 20%、token 消耗减少约 25%,长时程(long-horizon)任务与编码、视觉编码能力明显增强,复杂指令遵循改善、Agent 幻觉降低,可在同一线程跨多个工作流完成更长链条任务,并会主动追问、标注卡住状态、在关键操作前确认
  • 扎克伯格确认发布,称这是 Meta 迄今在编码与智能体工作上最大的一次跃升,价格「便宜到几乎不用计量」;Meta 官方串预告更大的模型与 Muse Spark 开放权重版本即将推出
  • Artificial Analysis 数据:智能指数 xhigh 61、max 62;xhigh 版每百万 token 定价 $1.25/$4.25,每个智能指数任务成本仅 $0.55,为其智能水平上成本效率最高模型;Coding Agent Index 上 xhigh 版每任务 $1.72 处于 Pareto 前沿,max 版因未公布定价暂无法计算;max 版在 Muse Code 中 Coding Agent Index 得 68 分,逼近 Claude Opus 5
  • Tau3-Bench Banking:max 版得 52% 成为该评测新第一;xhigh 版 47%,与 Claude Fable 5.1 (max) 等相当;相对 1.2 的提升集中在 GDPval-AA v2 等 agentic 评测
  • 模型支持 1M tokens 上下文;Reddit 用户 DistanceSolar1449 据第三方榜单认为 Meta 正在慢慢追回差距;第三方 aimlapi 做了维京手办单次生成对比 1.2

尚未确认

  • m1 称定价为每百万 token 输入 $0.10、输出 $0.20,与 Artificial Analysis 记录的 $1.25/$4.25 存在出入,待官方澄清
  • 开源权重版与更大模型的发布时间未公布;转发帖中关于 Watermelon(🍉)模型规格及切断员工使用竞品模型的说法仅为传闻

为什么重要

  • 五个月连发四款叠加智能指数连续跳升,显示 Meta 在快速缩小与头部模型的差距
  • 同等智能水平下做到同档最低任务成本,对按量付费的 Agent 应用有直接吸引力
  • 提升主要来自 GDPval-AA v2、Tau3-Bench Banking、Coding Agent Index 等 Agent 与编程类评测,表明迭代方向聚焦智能体与代码能力

还有 24 条相关讨论 →

第 2 集 · Meta 发布最强模型 Muse Spark 1.3,登顶赌局赔率仅 12%(2026-09-03,2 条)

据 Polymarket 快讯,Meta 发布其迄今最强 AI 模型 Muse Spark 1.3,AI 负责人 Alexandr Wang 宣称该模型编码能力超越 GPT-5.6 Sol。然而在 Polymarket「谁将在 12 月 31 日前拥有排名第一的 AI 模型」市场上,Meta 的赔率仅为 12%,显示市场对其登顶仍持谨慎态度。

第 3 集 · 实测 Meta Muse Spark:自改进两小时成本不足 1 美元(2026-09-03,3 条)

用户 @SPAC89 对比测试了 Meta 的 Muse Spark 1.3 Ultra 与 Fable 5.1:在相同提示词和最高推理档位下,设定自我改进规则(独立评审打分低于 9.5/10 就必须重试),各运行约 2 小时。结果显示 Muse Spark 1.3 约 1 分钟即可完成任务,而 Fable 5.1 花了 70 分钟和 13 美元;Muse Spark 还在 2 小时内跑了 20 轮自我改进、执行 60 多次智能体操作,成本不到 1 美元,令转发的 Scale AI CEO Alexandr Wang 表示惊叹。

第 4 集 · Meta 首席 AI 官点赞 muse spark 1.3 多智能体实测(2026-09-03,2 条)

Scale AI 创始人、Meta 首席 AI 官 Alexandr Wang 转发开发者 jaystar524 对 muse spark 1.3 的实测并称「哇,这相当酷」,为该产品造势。实测中开发者派出一批 sub-agents 并行工作,约一小时即完成任务,展现出多智能体协作的高效率。