返回 文章 apply CMS 文章

MiniMax M3:NVIDIA Blackwell 上部署长上下文推理与智能体工作流

MiniMax M3 统一多模态长上下文推理,在 NVIDIA Blackwell 上实现 10 倍吞吐量提升,支持 1M token 上下文和智能体工作流。

MiniMax M3多模态模型长上下文推理MoE
成长分 / 100 83 综合收获、行动、留存与影响

为什么值得读了解 MiniMax M3 的架构创新(MiniMax 稀疏注意力)如何实现高效长上下文推理。

掌握在 NVIDIA Blackwell 上部署和优化 MiniMax M3 的具体方法(TensorRT LLM、SGLang、vLLM、Dynamo、NeMo)。

关键洞察
  1. MiniMax M3 是 428B 参数的 MoE 模型,激活 22B 参数,支持 1M token 上下文和原生多模态输入。
  2. MiniMax 稀疏注意力(MSA)通过预过滤相关上下文块,将计算量降至 M2 的 1/20,预填充速度提升 9 倍,解码速度提升 15 倍。
  3. 在 NVIDIA Blackwell B300 MTP 上,MiniMax M3 的吞吐量比 H100 高出 10 倍,交互性翻倍。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:6968

随着企业级AI应用的规模化,开发者越来越被迫拼凑碎片化的流水线——为文本、视觉和代码分别使用不同的模型——这导致了复杂性增加、成本上升和迭代速度变慢。

MiniMax M3——可在包括NVIDIA Blackwell在内的NVIDIA加速基础设施上使用——通过支持单一多模态系统,能够进行长上下文推理、智能体工作流和创意任务,从而改变了这一现状。

这个428B参数的MoE模型支持高达100万token和原生多模态输入。开发者可以构建诸如长视频理解、长时间编码会话(8小时以上)以及高质量设计工作流等应用——所有这些都通过一个统一的模型和在NVIDIA平台上的生产级部署路径实现。

名称 | MiniMax M3 |

输入模态 | 视频、图像、文本 |

总参数量 | 428B |

视觉编码器参数量 | 600M |

激活参数量 | 22B |

上下文长度 | 1M |

专家数 | 总共128个,每个token激活4个专家 |

精度格式 | BF16, MXFP8 |

表1. MiniMax M3 VLM MoE模型规格

MiniMax M3的核心架构创新是MiniMax稀疏注意力(MSA),它用预过滤阶段取代了标准的二次注意力,该阶段识别相关的上下文块并仅关注这些块。在算子层面,每个KV缓存块通过连续内存访问读取一次——比现有的稀疏注意力实现快4倍以上。这使得在1M token上下文下,每个token的计算量仅为M2的1/20,预填充速度提升9倍,解码速度提升15倍,且无需压缩键值或牺牲精度。该模型还从第0步开始,在约100万亿交错token上原生训练文本、图像和视频,而不是在训练后添加多模态能力。

视频1. NVIDIA API目录中的MiniMax M3,开发者可以在使用该模型构建之前测试提示、调整参数并探索推理控制

NVIDIA Blackwell性能洞察

MiniMax M3专为新型多模态长上下文推理而构建,NVIDIA Blackwell提供了规模和低延迟性能,以高效地服务它。在MiniMax M3上,NVIDIA Blackwell Ultra的吞吐量比上一代NVIDIA Hopper(如图1所示)高出10倍,交互性翻倍,并提高了AI工厂的吞吐量。

折线图显示,随着交互性增加,绿色B300 MTP曲线始终远高于灰色H100 M3 Eagle曲线,图表中部附近标注了10倍,突出显示了每GPU吞吐量更高和用户体验更响应。

图1. 与NVIDIA H100相比,NVIDIA Blackwell B300 MTP在MiniMax M3上实现了高达10倍的吞吐量提升,从而在ISL/OSL 8K/1K下实现更响应的推理

这些提升源于硬件和软件的极致协同设计。通过推测解码、MTP和保持精度的NVFP4加速,随着堆栈在NVIDIA Dynamo和NVIDIA CUDA内核上的持续优化,Blackwell有望进一步推动MiniMax M3的性能。

开源推理

开发者可以使用他们选择的开源推理引擎(如NVIDIA TensorRT LLM(仅文本)、SGLang或vLLM)来使用加速计算。

使用NVIDIA TensorRT LLM部署

这些优化可在 NVIDIA TensorRT LLM GitHub 仓库 中获取。按照快速入门指南搭建高性能服务器——该指南涵盖从 Hugging Face 下载模型检查点、即用型 Docker 容器,以及低延迟和最大吞吐量服务的配置选项。NVIDIA 还通过 Transformers 库在开发者体验方面进行了合作。

使用 SGLang 部署

使用 SGLang 服务框架部署模型的用户可参考以下说明。更多信息和配置选项请参见 SGLang 文档

# 8 GPU节点案例
$ python -m sglang.launch_server \
--model-path MiniMaxAI/MiniMax-M3 \
--dtype bfloat16 \
--tp-size 8 \
--ep-size 8 \
--trust-remote-code \
--mem-fraction-static 0.8 \
--enable-multimodal \
--quantization mxfp8 \
--attention-backend flashinfer \
--mm-attention-backend flashinfer_cudnn \
--moe-runner-backend deep_gemm \
--chunked-prefill-size 8192 \
--reasoning-parser minimax-m3 \
--tool-call-parser minimax-m3-nom
--tr

使用 vLLM 部署

当使用 vLLM 服务框架部署模型时,请遵循以下说明。更多信息,请参阅 vLLM 配方

vllm serve MiniMaxAI/MiniMax-M3 \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--block-size 128 \
--mm-encoder-attn-backend FLASHINFER \
--mm-processor-cache-type shm \
--tool-call-parser minimax_m3 \
--enable-auto-tool-choice \
--reasoning-parser minimax_m3 \
--trust-remote-code

使用 NVIDIA Dynamo 进行扩展

Dynamo 是一个开源分布式推理服务平台,供开发者部署 MiniMax M3 等前沿模型以用于大规模应用。使用 Dynamo 与 TensorRT LLM 部署 MiniMax M3 可在不牺牲吞吐量或增加 GPU 预算的情况下,提升长输入序列长度的性能。

Dynamo 集成了所有主流推理引擎和框架,包括 PyTorch、SGLang、TensorRT LLM 和 vLLM,并提供 LLM 感知路由、弹性自动缩放和低延迟数据传输。开发者可以按照部署指南使用 Dynamo 运行 MiniMax M3。

使用 NVIDIA NeMo 框架进行定制

MiniMax M3 可以使用开源 NVIDIA NeMo 框架进行定制和微调。用户可以:

  • 使用 NVIDIA NeMo AutoModel对 Hugging Face 检查点进行开箱即用的微调(包括 SFT 和 LoRA),无需任何转换,并通过完整的 N 维并行实现高吞吐量加速。具体来说,支持上下文并行,序列长度可达 128k。

  • 使用

NVIDIA NeMo RL在 MiniMax M3 之上进行强化学习,参考以下示例准确率曲线

这些库为开发者提供了一套轻量级工具,用于快速试验最新的前沿模型。

立即开始

开发者可以通过 build.nvidia.com 上的 GPU 加速 API 或从 Hugging Face 下载权重来原型化和评估 MiniMax M3。