返回 文章 学习 CMS 文章

Meta 发布 Muse Image 并预览 Muse Video:首批媒体生成模型

Meta 首批媒体生成模型 Muse Image 与 Muse Video 发布,图像模型以智能体方式运行并已上线 Meta 生态。

MetaMuse ImageMuse Video图像生成
成长分 / 100 77 综合收获、行动、留存与影响

Meta 发布 Muse Image 并预览 Muse Video:首批媒体生成模型
为什么值得读了解 Meta Superintelligence Labs 首批媒体生成模型的核心能力与发布范围。

理解 Muse Image 如何通过工具使用、自我精炼和测试时计算扩展提升生成质量。

关键洞察
  1. Muse Image 作为智能体运行,调用搜索和编码工具提高准确性,并对自身生成结果进行自我精炼。
  2. 自我精炼行为在 RL 训练过程中自然涌现,而非人为设计,因为自我精炼产生了更好的图像从而获得更高奖励。
  3. 测试时计算扩展可提升人类偏好 Elo 分数,呈现近似对数线性关系;推理与工具使用结合产生叠加效应。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:6058

我们很高兴推出 Muse Image,并预览 Muse Video,这是 Meta Superintelligence Labs 开发的首批媒体生成模型。

Muse Image 是我们迄今为止最先进的图像生成模型:它能忠实遵循指令,精准编辑,并能基于多个参考进行构图。它还带来了智能体工具使用能力,并与 Muse Spark 集成。Muse Video 基于相同的预训练基础构建,提供卓越的视觉保真度,并原生支持音频。

Muse Image 今日已在 Meta AI 应用和 meta.ai、美国地区的 Instagram Stories,以及有限国家的 WhatsApp 上线,并即将登陆 Facebook。Muse Video 即将面向创作者和 Meta AI 推出。

Muse Image:智能体图像生成

Muse Image 并非直接将提示映射为图像,而是作为一个智能体运行:它调用搜索和编码工具来提高准确性,对自身生成结果进行自我精炼,并通过扩展测试时计算来改进。Muse Image 还与 Muse Spark 集成,使两个模型能够共享工具并联合规划,以实现强大的智能体媒体生成。

工具使用

我们为 Muse Image 提供工具访问权限,以增强其智能体能力。

编码。 在强化学习过程中,Muse Image 学会编写和执行代码,以生成准确的图表和二维码,并以渲染出的图形为条件来提高生成图像的准确性。Muse Spark 和 Muse Image 也集成在一起,利用代码和媒体生成的组合来创建动画 GIF、嵌入图像的网站以及交互式视觉游戏。

搜索。 Muse Image 学会搜索网络,使生成的图像基于事实和实时信息以及视觉参考。启用搜索可提高知识密集型提示的事实准确性,尤其是涉及当前事件和现实世界事实的提示。

Muse Image 通过搜索工具使用得到改进。来自内部消融实验的胜率。

自我精炼

Muse Image 在其思维链中反思并改进自己的工作。这种自我精炼行为可以采取不同形式:当小细节有误时,对当前图像草稿进行局部编辑;当较大部分出错时,从头生成新图像;或采取不同策略,如使用工具进行更符合事实的生成。我们并未设计这种行为。相反,它是在 RL 训练过程中自然涌现的,仅仅因为自我精炼产生了更好的图像,从而获得更高的奖励。

Muse Image 通过涌现的自我精炼得到改进。来自内部消融实验的胜率。

测试时计算扩展

与语言模型一样,Muse Image 在推理时思考得越多,表现就越好。随着测试时计算的增加,模型进行更多推理,使用更多工具调用,并采用更多自我精炼步骤来改进其生成结果。提高推理强度(从而增加测试时计算)可提升人类偏好 Elo 分数,并显示出近似对数线性的扩展关系。值得注意的是,这种计算涵盖两种非常不同的工作——用于推理的文本 token,用于生成的视觉 token——但质量是总计算量组合的函数。

我们发现,明智地使用 token 预算对于有效的测试时扩展同样重要。Best-of-N(BoN)让模型生成多张图像并保留最佳结果,能在早期提升质量,但很快就会饱和。将同样的算力用于深思熟虑的推理,其扩展效果要好得多。推理与工具使用相结合时会产生叠加效应。工具让模型能够触及它已有知识之外的范围,无论是搜索它所缺乏的参考资料,还是编写代码以精确处理细节,从而填补仅靠推理无法弥补的空白。

Muse Image 随着测试时算力的扩展而提升。Elo 来自内部消融实验。

图像编辑

Muse Image 能够精确地编辑图像,完全按照用户的要求进行修改。正如我们的示例所示,它可以遵循各种指令。

Muse Image 在多次编辑轮次中保持连贯性,支持迭代优化和开放式头脑风暴,以达成目标结果。

多参考图像合成

Muse Image 可以在提示中组合来自多张输入参考图像的元素,包括人物、物体、服装、风格和环境。它支持在提示中内联交错文本和图像,以实现复杂的图像合成。

图像基准测试

截至撰写本文时,根据人类偏好 Elo 排名,Muse Image 在文本生成图像、单图像编辑和多图像编辑方面均位列 Arena 第二名。

截至 2026 年 7 月 5 日的 Arena Elo 排名。

截至 2026 年 7 月 5 日的 Arena Elo 排名。

截至 2026 年 7 月 5 日的 Arena Elo 排名。

Muse Video 预览

在发布 Muse Image 的同时,我们分享 Muse Video 的早期预览。它在提示遵循、视觉保真度和时间一致性方面提供了有竞争力的表现。我们正在投资于当前存在性能差距的领域,例如音视频同步和物理准确的快速运动。Muse Video 即将面向创作者和 Meta AI 推出。

在 Arena 上,截至撰写本文时,Muse Video 在文本生成视频的人类偏好 Elo 中排名第三。

截至 2026 年 7 月 5 日的 Arena Elo 排名

内容印章

为了帮助人们验证图像是否为 AI 生成,Muse Image 包含 Content Seal,这是我们不可见的水印系统。在 Meta AI 应用和 meta.ai 上由 Muse Image 创建的图像带有隐藏的来源信号,即使经过裁剪、压缩、调整大小或截图,该信号依然保持完整。我们计划很快将 Content Seal 扩展到视频。我们正在预览一个

Meta 产品中的 Muse Image

Muse Image 与 Meta 生态系统深度连接。我们在图像和视频生成方面的持续投资将进一步使创作者和企业能够在 Meta 产品中生成动态内容。

面向小型企业的营销素材

直接在 Instagram 中提供个性化预设

我们的最新动态直接发送到您的收件箱

订阅我们的新闻通讯,随时了解 Meta AI 新闻、活动、研究突破等更多内容。