专题 · FULL STORY

Meta 发布 Muse Code:以价换数据登顶评测

Meta 发布终端编程智能体 Muse Code 及模型 Muse Spark 1.2。该模型凭借极低成本的“以价换数据”策略引发行业关注,并在随后的金融 Agent 与性价比等多项权威评测中接连登顶。

2026-08-06 ~ 2026-08-07 · 4 集 · 65 条

第 1 集 · Meta 发布终端编程智能体 Muse Code(2026-08-06,44 条)

Meta AI Research 官方发布了终端编程智能体 Muse Code(Beta 版)及其驱动模型 Muse Spark 1.2,相关 API 已面向全球开发者开放。该工具专为处理大型代码库中的复杂软件工程任务而设计,标志着 Meta 在编程智能体领域的重要推进。

已确认

  • 产品与模型:Muse Code 目前处于测试版阶段,支持通过一行命令行安装,已上线 macOS 和 Linux 公测版。该工具由专注于编码能力优化的全新模型 Muse Spark 1.2 驱动。Muse Spark 1.2 大幅扩展了编程任务的训练计算量并丰富了训练环境,且与 Muse Code 进行了联合训练。
  • 核心能力:该智能体能够处理跨大型代码库的完整软件工程任务,包括规划代码变更、编写代码以及验证结果。它配备了多个持久化的异步后台子智能体,能够在后台持续处理长周期的复杂任务,并在整个会话期间保持运行。
  • 评测表现:据 alexandrwang 转述的初步跑分,Muse Code 在 DeepSWE 1.1 评测基准中取得了 59% 的高分。

为什么重要

  • Muse Code 的发布为全球开发者提供了一个原生终端的智能体工具。其异步后台与多文件处理能力,直接瞄准了大型真实代码库中的复杂工程痛点,有望大幅提升长周期软件工程的自动化水平。扎克伯格亲自发文宣传,也凸显了该产品在 Meta 战略中的重要性。

还有 24 条相关讨论 →

第 2 集 · Meta发布MuseSpark 1.2与MuseCode,低价换取数据引爆行业(2026-08-06,15 条)

Meta 正式发布编程智能体环境 MuseCode 及配套大模型 MuseSpark 1.2,试图在 AI 编程领域抢占市场。其核心策略是“以价换数据”,通过极低的 API 定价换取用户数据用于模型训练,引发了行业对 AI 价格战及数据隐私模式的高度关注。

已确认

  • 产品发布与评测:Meta 推出了专注于处理大型代码库跨文件复杂工程任务的 MuseCode,采用主循环结合常驻异步后台智能体的架构,具备精确回放与重启安全能力。配套的 MuseSpark 1.2 在代码生成和复杂调试上大幅优化。在 Artificial Analysis 智能指数中,该模型得分 54,使 Meta 跻身全美实验室前三。据 @alexandrwang 转述,其编码能力已追平 GPT-5.6 和 Fable,并在 deepSWE 评测中击败 Gemini 3.6 Flash 和 Grok 4,在 SideQuest 榜单中也冲上第二。
  • 定价策略:该模型采取差异化定价。若用户允许数据用于训练(即“贡献者”选项),API 价格将大幅下降。据 @智东西 与 @歸藏的AI工具箱 等作者披露,输入价格最低仅 0.10 美元/百万 Tokens,比标准价便宜 12.5 倍;缓存和输出价格分别为 0.002 美元和 0.20 美元/百万 Tokens。

尚未确认

  • @cedricchee 在体验后认为模型能力接近 Grok 4.5,但他指出若想真正具备市场竞争力,定价策略还需向 DeepSeek-V 看齐,暗示目前的绝对价格或仍有调整空间。

为什么重要

  • 商业模式重塑:@ImaginaryDinner2710 与 @teortaxesTex 认为,该模型的输入、输出及缓存命中成本甚至低于 V4-Flash,仅为 DeepSeek 等竞品价格的七折左右。这表明 Meta 目前并不在意利润率,而是将获取高质量编程数据以改进产品作为首要目标。这种以极低价换取数据的新模式,不仅可能对现有的 AI 编程市场格局造成严重冲击,还可能迫使其他大厂或国产模型跟进,引发新一轮的 AI 价格战。

第 3 集 · Muse Spark 1.2 登顶金融 Agent 评测(2026-08-06,4 条)

在 Vals AI 推出的 Finance Agent v2 基准测试中,Muse Spark 1.2 表现亮眼,成为首个突破 60% 准确率大关并登顶的模型。该模型在保持极高性能的同时展现出卓越的性价比,单次测试成本仅为 0.69 美元,约为同梯队竞品(如 Kimi 和 Opus)的十分之一到三分之一。

第 4 集 · Meta Muse Spark 1.2登顶性价比前沿,成本仅为Claude六分之一(2026-08-07,2 条)

据Artificial Analysis最新评测,Meta的Muse Spark 1.2模型在“智能指数vs单任务成本”的帕累托前沿上表现抢眼,登顶性价比前沿。其智能得分仅略低于Claude Opus,但单任务成本仅为后者的六分之一(另一报道称五分之一),展现出极高的成本效益。该模型在保持竞争力的同时大幅降低推理成本,或将对AI模型市场格局产生重要影响。