返回 文章 apply CMS 文章

Mistral Small 4 发布:统一推理、多模态与智能体编码的开源模型

Mistral Small 4 用一个开源模型统一了推理、多模态和编码智能体能力,并支持按需调整推理力度。

Mistral开源模型多模态推理优化
成长分 / 100 79 综合收获、行动、留存与影响

Mistral Small 4 发布:统一推理、多模态与智能体编码的开源模型
为什么值得读了解 Mistral 如何将多个专用模型能力整合到一个高效的开源模型中。

掌握 Mistral Small 4 的关键架构细节和性能提升数据。

关键洞察
  1. Mistral Small 4 是首个统一 Magistral(推理)、Pixtral(多模态)和 Devstral(智能体编码)的 Mistral 模型。
  2. 采用专家混合(MoE)架构,总参数 119B,每 token 激活 6B(含嵌入和输出层为 8B),支持 256k 上下文窗口。
  3. 引入 reasoning_effort 参数,可在快速响应(none)和深度推理(high)之间动态切换。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:7105

今天,我们宣布推出 Mistral Small 4。该模型是 Mistral Small 系列的下一个重大版本。Mistral Small 4 是首个将我们旗舰模型的能力——用于推理的 Magistral、用于多模态的 Pixtral 以及用于智能体编码的 Devstral——统一到一个多功能模型中的 Mistral 模型。借助 Small 4,用户不再需要在快速指令模型、强大推理引擎或多模态助手之间做出选择:一个模型现在即可提供全部三种能力,并具备可配置的推理力度和同类最佳效率。

Mistral Small 4 在 Apache 2.0 许可证下发布,延续我们对开放、可访问且可定制 AI 的承诺。

多模态、推理优化模型的新标准

Mistral Small 4 是一个混合模型,针对通用聊天、编码、智能体任务和复杂推理进行了优化。其架构支持文本和图像输入,使其适用于广泛的应用场景。通过 Mistral Small 4,我们重申对开源模型的承诺,并自豪地作为创始成员加入 NVIDIA Nemotron Coalition,共同推进 AI 开发中的协作与创新。

关键架构细节

专家混合(MoE):128 个专家,每个 token 激活 4 个,实现高效扩展与专业化。

总参数 119B,每个 token 激活参数 6B(包括嵌入和输出层为 8B)。

256k 上下文窗口,支持长格式交互和文档分析。

可配置推理力度:在快速、低延迟响应与深度、推理密集型输出之间切换。

原生多模态:接受文本和图像输入,解锁从文档解析到视觉分析的用例。

性能亮点

端到端完成时间减少 40%(延迟优化设置)。

与 Mistral Small 3 相比,每秒请求数增加 3 倍(吞吐量优化设置)。

为什么选择 Mistral Small 4?

统一能力

Mistral Small 4 将 Magistral(推理)、Devstral(编码智能体)和 Mistral Small(指令)的优势整合到一个模型中。无论您需要聊天助手、研究伙伴还是编码智能体,Small 4 都能适应您的任务,无需在专用模型之间切换。

按需推理

借助新的 reasoning_effort

参数,用户可以动态调整模型行为:

reasoning_effort="none"

:针对日常任务的快速、轻量响应,等同于 Mistral Small 3.2 的相同聊天风格。reasoning_effort="high"

针对复杂问题的深度、逐步推理,详细程度与之前的 Magistral 模型相当。

企业级效率

最低基础设施:4x

NVIDIA HGX H100、2xNVIDIA HGX H200 或 1xNVIDIA DGX B200。推荐设置:4x NVIDIA HGX H100、4x NVIDIA HGX H200 或 2x NVIDIA DGX B200 以获得最佳性能。

Mistral Small 4 完全开源。针对专门任务进行微调,或开箱即用部署于通用场景。得益于与社区的合作,它现已在 vLLM、llama.cpp、SGLang、Transformers 等平台上可用。

交付先进的开源 AI 模型需要广泛的优化。通过与 NVIDIA 的紧密合作,推理已针对开源 vLLM 和 SGLang 进行了优化,确保在各种部署场景下实现高效、高吞吐量的服务。

图:三个基准测试中的得分与输出长度对比。上:准确率得分(越高越好)。下:平均输出长度,以千字符计(越短越好)。

具备推理能力的 Mistral Small 4 取得了有竞争力的得分,在所有三个基准测试中匹配或超越 GPT-OSS 120B,同时生成的输出显著更短。在 AA LCR 上,Mistral Small 4 仅用 1.6K 字符就获得 0.72 分,而 Qwen 模型需要 3.5-4 倍的输出(5.8-6.1K)才能达到相当的性能。在 LiveCodeBench 上,Mistral Small 4 超越 GPT-OSS 120B,同时输出减少 20%。这种效率差距在实践中很重要:更短的输出意味着更低的延迟、更低的推理成本和更好的用户体验。

面向企业买家:

每 token 的效率直接影响成本和可扩展性。随着响应变长而保持或提升性能的模型,减少了对人工干预的需求,降低了运营成本,并确保一致的质量,即使对于报告生成、客户支持或决策工作流等复杂、高风险任务也是如此。混合推理模型通过在不按比例增加资源使用的情况下最大化准确率,提供更好的价值,使其成为性能和成本效率都至关重要的大规模部署的理想选择。

面向技术团队和数据科学家:

每 token 的性能是模型选择和优化的关键指标。高效扩展的模型使团队能够为更长、更细致的任务(例如详细分析、多步推理)部署解决方案,而不会牺牲准确率或增加计算成本。这意味着在质量和资源分配之间的权衡更少,从而实现更具创新性和可靠性的 AI 驱动应用。它还简化了微调和集成,因为模型的稳健性减少了对持续调整或回退系统的需求。

预期用例

Mistral Small 4 专为以下用途设计:

开发者:编码自动化、代码库探索和代码代理工作流。

企业:通用聊天助手、文档理解和多模态分析。

研究人员:数学、研究和复杂推理任务。

其开源许可证和可定制架构使其成为微调和专业化的理想选择。

可用性

Mistral API 和

AI Studio开发者可以在 NVIDIA 加速计算上免费试用 Mistral Small 4 原型,网址为

build.nvidia.com,对于生产部署,Mistral Small 4 作为 NVIDIA NIM 在 day-0 即可用,开箱即提供优化的容器化推理。它还可以通过NVIDIA NeMo进行定制,用于特定领域的微调。客户的技术文档可在我们的

AI Governance Hub上获取

对于企业部署、自定义微调或本地部署解决方案,请联系我们的团队

AI 的未来是开放的

通过统一指令、推理和多模态能力,Mistral Small 4 简化了 AI 集成,使用户能够借助单一、可适配的工具应对更广泛的任务,将开源 AI 的优势带入现实世界的应用场景。