今天,我们很高兴推出 Muse Spark 1.1,这是 Meta Superintelligence Labs 的最新模型,也是 Muse Spark 的一次重大升级。Muse Spark 1.1 是一款为智能体任务构建的多模态推理模型,在工具与计算机使用、编程以及多模态理解方面均有大幅提升。
凭借这些改进,Muse Spark 1.1 推进了性能与效率的前沿。结合本周发布的 Muse Image,此次发布让我们更接近个人超级智能的愿景:帮助您追求目标、创造想象之物、加深人际关系,并对您最看重的事情采取行动的模型。
伴随此次发布,我们同时推出新的 Meta Model API 公开预览版,开发者可通过该 API 访问 Muse Spark 1.1。该模型现已在 Meta AI 应用中以“Thinking”模式提供,并可在
评估
有关我们评估的更多详情,请参阅我们的报告。
智能体
Muse Spark 1.1 在需要跨一系列外部应用和服务进行规划与编排的个人智能体任务中表现出色。它能零样本泛化到新的原生工具、MCP 服务器和自定义技能。
它处理复杂项目的速度显著快于 Muse Spark,因为它经过训练可以编排多智能体系统以优化端到端延迟。作为主智能体,它可以收集上下文、制定计划,并将执行任务委派给并行的子智能体。作为子智能体,它恪守自身职责,理解可用工具,并知道何时应上报回主智能体。
Muse Spark 1.1 可以主动管理其 100 万 token 的上下文窗口。它能记住操作、从更早的工作中检索信息,并以保留后续工作所需关键步骤的方式进行压缩。
计算机使用
Muse Spark 1.1 擅长在多个应用之间展开、信息实时变化的计算机使用工作流。它能在长时间会话中保持上下文,适应不断变化的需求,并在极少人工干预的情况下驾驭不熟悉的界面。
Muse Spark 1.1 不会对每个桌面步骤逐次点击进行推理,而是理解何时应自动化、何时应直接使用界面。我们训练该模型在自动化更快时编写脚本,在直接交互更简单时点击,并在每一步生成批量操作。
智能体组织晚宴:在现实应用中,会出现改变任务的新上下文。Muse Spark 1.1 在下单晚宴时能注意到这些变化,并在无需用户干预的情况下进行必要更新。
编程
Muse Spark 1.1 的编程性能在涉及大型、复杂代码库的现实任务上大幅提升。它可以诊断并修复复杂缺陷,在企业级系统中实现新功能,并执行大规模代码迁移。在创建 Web 应用和端到端问答等用例中,Muse Spark 1.1 相较我们的首个模型展现出大幅提升。
我们训练模型以平滑适应多样化的运行框架,并可靠处理复杂的多轮动态。Muse Spark 1.1 在流行的智能体编程配置中表现良好,支持规划模式、目标条件化、子智能体委派和上下文压缩等常见功能。
在 OpenCode 中调试演示:Muse Spark 1.1 构建一个聊天 Web 应用,通过自动截图识别用户可见的故障,将问题追溯到相关代码以实施修复,并验证这些更改。该模型无缝结合了编码、多模态理解和工具调用。
在 Meta 内部,开发人员和研究人员每天都在使用 Muse Spark 1.1 来更快地构建和更智能地工作。在我们的主要内部编码评估 Meta Internal Coding Bench 上,Muse Spark 1.1 相比 Muse Spark 有显著改进,并且与领先的替代方案具有竞争力。
研究人员现在还在工作流程中利用 Muse Spark 1.1 来自动化模型开发和评估任务。
在 OpenCode 中进行 DeepSWE 评估:Muse Spark 1.1 在不同推理强度下对 DeepSWE 任务的子集进行自我评估,并根据结果生成分析仪表板。
多模态
除了编码和代理能力外,Muse Spark 1.1 在感知、多模态推理和工具使用方面表现出色。它可以与真实环境交互并产生有依据的输出,在视觉到代码工件生成、超描述性图像和视频字幕以及多模态用例的代理工作流执行方面具有优势。
当感知和行动需要同时发生时,Muse Spark 1.1 的多模态能力尤其有价值。该模型可以检查视觉和音频,在长工作流中保留细节,并在代表用户操作计算机时使用这些细节。
Facebook Marketplace 代理:使用智能手机拍摄的视频,Muse Spark 1.1 提取有用的照片并对产品进行推理,以操作用户的浏览器并代表用户在 Facebook Marketplace 上发布列表。
安全性
我们在部署前进行了广泛的安全评估,遵循高级 AI 扩展框架,该框架为我们最先进的模型定义了评估、威胁模型和部署阈值。
在所有前沿风险类别——化学与生物、网络安全和失控——中,我们的评估表明 Muse Spark 1.1 在安全范围内运行。Muse Spark 1.1 对直接越狱和来自不可信数据的间接攻击、提示注入和开发者提示攻击表现出强大的抵抗力。因此,它显示出更好的对抗鲁棒性、更低的幻觉率和减少的谄媚。
我们针对 1.1 的完整安全态势记录在我们的 Muse Spark 1.1 评估报告中。
可用性
首次,开发人员可以通过新的 Meta Model API(现已公开预览)开始使用 Muse Spark 1.1 进行构建。Muse Spark 1.1 的早期合作伙伴称赞该模型是一个完整的代理基础,将长上下文处理与强大的编码和推理能力相结合,以处理大规模代理工作负载。
“Muse Spark 最令人印象深刻的是它将如此多的功能打包到一个模型中:百万令牌的大规模上下文、完整的多模态支持(图像、视频、PDF)、带引用的内置搜索、强大的推理、顶级的编码能力(尤其是前端和设计)、结构化输出和并行工具调用——所有这些都封装在一个干净的 OpenAI 兼容包中。一个完整的代理基础。”
—— Amjad Masad,Replit 首席执行官
“Meta 显然正在为严肃的智能体编程而构建——以能够支撑大规模运行真实编程工作负载的价格点提供强大的工具使用能力。这种组合十分罕见,也正是我们希望 Cline 开发者能够尽早获得访问权限的原因。”
—— Saoud Rizwan,Cline 首席执行官
“在 Box 的企业工作评估集上进行测试时,Muse Spark 展现出的企业级能力可与当今领先的前沿模型相媲美。这种智能水平,结合其在专业服务、公共部门和工业运营等行业中结构化、流程化工作流方面的优势,使其成为各类组织极具吸引力的选择。”
—— Yashodha Bhavnani,Box AI 产品副总裁
“Muse Spark 1.1 是一款非常适合运行智能体的模型。快速、强大,搭配 OpenClaw 使用乐趣十足。”
—— Dave Morin,OpenClaw 基金会
我们非常高兴地发布 Muse Spark 1.1,这是我们研究势头的有力证明。我们还有能力更强的模型正在训练中,期待与大家分享未来的成果。
