Meta发布Muse Image与Muse Video模型

Meta超级智能实验室(MSL)正式发布其首批媒体生成模型:图像模型Muse Image与视频模型Muse Video。这是Meta在AI架构重组后推进多模态生成能力自研化的重要一步,相关技术细节与评测结果同步发表于研究博客。

核心能力与技术细节

Muse Image定位为具备Agent能力的模型。它可与Muse Spark配合,在生成前先推理提示词、搜索网页并规划,号称能“一次得到用户想要的效果”。技术层面,该模型由强化学习驱动,利用测试时计算(test-time compute)获得了近线性的Elo增益。此外,它支持多张参考图(人物、物品、服饰等)合成复杂构图,并能编写执行代码以精确生成图表和二维码。

评测表现与实测反馈

在LMArena榜单中,Muse Image在多图生成与单图编辑竞技场均位列第二,其中多图生成领先第三名Nano Banana 2达23分。实测方面,用户@markk认为其文本与细节渲染效果良好,已接近完美。但@spobin将其与OpenAI gpt-image-2、Google Nano Banana 2进行同题对比测试后曝光了横评结果(采用固定27分制)。

联网搜索与落地应用

为提升现实知识与事实性类别的准确度,Muse Image引入了联网搜索机制,用实时信息为生成结果提供参考。应用落地上,该模型将接入Meta AI应用,并为Instagram的图片编辑功能及广告营销工具提供底层支持。同步预览的Muse Video模型则在提示词遵循、视觉保真度与时序一致性上展现出竞争力。

2026-07-08 ~ 2026-07-10 · 71 条相关

一手来源

另有 4 条近重复转述:Polymarket · rohanpaul_ai · alexandr_wang · rohanpaul_ai