今天,我们非常激动地推出 Muse Spark,这是由 Meta Superintelligence Labs 开发的 Muse 系列模型中的首个模型。Muse Spark 是一个原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排。
Muse Spark 是我们扩展阶梯上的第一步,也是我们从头开始全面改革 AI 工作的首个产品。为了支持进一步的扩展,我们正在整个技术栈上进行战略投资——从研究和模型训练到基础设施,包括 Hyperion 数据中心。
在这篇文章中,我们将首先探索 Muse Spark 的新能力和应用。在这些成果之后,我们将揭开帷幕,看看推动我们迈向个人超级智能的扩展轴。
Muse Spark 今天已在 meta.ai 和 Meta AI 应用上提供。我们正在向部分用户开放私有 API 预览。
个人超级智能的能力
Muse Spark 在多模态感知、推理、健康和智能体任务方面提供了有竞争力的性能。我们继续投资于当前存在性能差距的领域,例如长时程智能体系统和编码工作流。
随着更大模型的开发,这些结果表明我们的技术栈正在有效扩展。
我们还发布了 Contemplating 模式,它编排多个并行推理的智能体。这使得 Muse Spark 能够与 Gemini Deep Think 和 GPT Pro 等前沿模型的极端推理模式竞争。Contemplating 模式在挑战性任务中提供了显著的能力提升,在 Humanity's Last Exam 中达到 58%,在 FrontierScience Research 中达到 38%。
Muse Spark 现已可用,Contemplating 模式将在 meta.ai 中逐步推出。
*有关我们评估的更多详细信息,请参阅我们的方法论文档。
应用
Muse Spark 是迈向理解你世界的个人超级智能的第一步。从分析你的即时环境到支持你的健康,Muse Spark 的高级推理能力实现了强大、高度个性化的用例。
多模态。 Muse Spark 从头开始构建,以整合跨领域和工具的视觉信息。它在视觉 STEM 问题、实体识别和定位方面取得了强劲性能。这些能力结合在一起,实现了互动体验,例如创建有趣的小游戏或通过动态注释排除家用电器故障。
健康。 个人超级智能的一个主要应用是帮助人们了解和改善健康。为了提高 Muse Spark 的健康推理能力,我们与 1,000 多名医生合作,策划训练数据,以实现更真实和全面的响应。Muse Spark 可以生成交互式显示,解析和解释健康信息,例如各种食物的营养成分或运动时激活的肌肉。
要构建个人超级智能,我们模型的能力应当能够可预测且高效地扩展。下面,我们分享我们如何沿着三个轴研究和追踪 Muse Spark 的扩展特性:预训练、强化学习和测试时推理。
预训练。预训练阶段是 Muse Spark 获得其核心多模态理解、推理和编码能力的阶段——这是强化学习和测试时计算所依赖的基础。
在过去九个月里,我们重建了预训练栈,改进了模型架构、优化和数据整理。这些进步共同提升了我们从每单位计算中能够提取的能力。为了严格评估我们的新配方,我们对一系列小模型拟合了扩展定律,并比较达到特定性能水平所需的训练 FLOPs。结果很明确:与之前的模型 Llama 4 Maverick 相比,我们能够以少一个数量级以上的计算量达到相同的能力。这一改进也使 Muse Spark 比可供比较的领先基础模型显著更高效。
强化学习。 预训练之后,强化学习(RL)利用计算来可扩展地放大模型能力。尽管大规模 RL 众所周知容易不稳定,我们的新栈仍能带来平滑、可预测的收益。
下面的图表展示了为 Muse Spark 扩展 RL 计算(以步数衡量)的好处。左侧,我们看到训练数据上 pass@1 和 pass@16(16 次尝试中至少成功一次)的对数线性增长。这表明 RL 在提高模型可靠性的同时没有损害推理多样性。右侧,在留出评估集上的准确率增长表明 RL 的收益可预测地泛化:Muse Spark 在训练中未见过的任务上平滑改进。
测试时推理。 RL 训练我们的模型在回答之前“思考”——这一过程称为测试时推理。向数十亿用户提供这一能力需要高效使用推理 token。为实现这一点,我们依赖两个关键杠杆:思考时间惩罚以优化 token 使用,以及多智能体编排以在不减慢响应时间的情况下提升性能。
为了在每个 token 上提供最大智能,我们的 RL 训练在思考时间惩罚的约束下最大化正确性。在 AIME 等部分评估上,这会导致相变。在模型通过思考更久而改进的初始阶段之后,长度惩罚导致思维压缩——Muse Spark 压缩其推理,以显著更少的 token 解决问题。压缩之后,模型再次扩展其解决方案以实现更强的性能。
为了在不显著增加延迟的情况下花费更多测试时推理,我们可以扩展协作解决难题的并行智能体数量。下图说明了这种方法的好处。标准测试时扩展让单个智能体思考更久,而用多智能体思维扩展 Muse Spark 则能在可比延迟下实现更优性能。
安全
Muse Spark 在双用途科学领域具备广泛的推理能力,因此我们在部署前进行了大量安全评估。我们的流程遵循更新后的高级 AI 扩展框架,该框架为我们最先进的模型定义了威胁模型、评估协议和部署阈值。我们在应用安全缓解措施前后,针对前沿风险类别、行为对齐和对抗鲁棒性对 Muse Spark 进行了评估。
我们发现,得益于预训练数据过滤、以安全为重点的后训练以及系统级防护措施,Muse Spark 在生物和化学武器等高风险领域表现出强烈的拒绝行为。在网络安全和失控领域,Muse Spark 未表现出实现威胁情景所需的自主能力或危险倾向。我们的评估显示,鉴于其部署背景,Muse Spark 在我们所测量的所有前沿风险类别中均处于安全边际之内。完整结果见我们的安全与准备报告。
在针对接近发布版本的检查点进行的第三方评估中,Apollo Research 发现,Muse Spark 在他们所观察过的模型中表现出最高的评估意识率。该模型经常将情景识别为“对齐陷阱”,并推理认为自己应当诚实表现,因为它正在被评估。这一点很重要,因为能够识别评估情境的模型在测试期间的行为可能与部署时不同。然而,这些结果并不能确认这种意识会直接改变行为,而我们自己的后续调查发现了初步证据,表明评估意识可能会在一小部分对齐评估中影响模型行为,而这些评估均与影响模型发布决策的危险能力或倾向无关。我们得出结论,这不是发布的阻碍性问题,但值得进一步研究。更多内容请阅读我们的安全与准备报告。
结论
借助 Muse Spark,我们正走在一条可预测且高效的扩展轨迹上。我们期待在通往个人超级智能的道路上很快分享能力日益增强的模型。
