返回 文章 学习 CMS 文章

Qwen3.8-Flash-Next 预览版发布:1250 亿参数 MoE 模型在 NVIDIA GB300 NVL72 上实现智能体编码

阿里巴巴发布 Qwen3.8-Flash-Next 预览版,通过 GDN+QSA 混合架构解决长上下文推理瓶颈,并在 NVIDIA GB300 NVL72 上验证了高性能智能体编码能力。

Qwen3.8-Flash-NextMoE长上下文推理NVIDIA GB300 NVL72
成长分 / 100 79 综合收获、行动、留存与影响

Qwen3.8-Flash-Next 预览版发布:1250 亿参数 MoE 模型在 NVIDIA GB300 NVL72 上实现智能体编码
为什么值得读了解即将推出的 Qwen4 架构预览版的核心技术细节,包括 Gated DeltaNet 和 Qwen Sparse Attention 的混合设计原理

获取在 NVIDIA GB300 NVL72 上部署和运行该模型的完整技术路径,包括推理引擎选择和后训练方案

关键洞察
  1. Qwen3.8-Flash-Next 是 1250 亿参数主模型加 510 亿参数 N-gram 嵌入的多模态 MoE 模型,每 token 激活 60 亿参数,原生支持 262,144 token 上下文,可通过 YaRN 扩展至 100 万 token
  2. 模型采用每四层中三层 GDN 加一层 QSA 的混合架构:GDN 将历史上下文压缩为固定大小循环状态以消除 KV 缓存增长,QSA 在块级别估计重要性并仅选择最相关区域进行精确检索
  3. QSA 在预填充阶段实现高达 7.6 倍注意力内核加速,解码阶段实现 4.9 倍加速;在 100 万 token 上下文和 90% 前缀缓存命中率的测试中,预填充吞吐量达到 Qwen3.7-Plus 的 8.6 倍
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:5677

阿里巴巴发布了 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构的预览版,供开发者进行实验和评估。这是一个多模态混合专家(MoE)模型,主模型拥有 1250 亿参数,并额外补充了 510 亿参数的 N-gram 嵌入,每个 token 激活 60 亿参数。它具有原生的 262,144 token 上下文窗口,可通过 YaRN 扩展至 100 万 token。

NVIDIA 通过 SGLang、vLLM 和 NVIDIA TensorRT LLM 提供尽力而为的 Day 0 功能支持,在 NVIDIA GB300 NVL72 上进行推理验证,并提供来自 NVIDIA NeMo AutoModel 和 NVIDIA NeMo RL 的后训练配方。

面向长上下文推理的架构创新

Qwen3.8-Flash-Next 专为高容量、上下文密集型应用而设计,例如智能体编码、文档处理和工具驱动的工作流。随着上下文增长,注意力计算和 KV 缓存内存成为瓶颈。该模型通过结合 Gated DeltaNet (GDN) 和 Qwen Sparse Attention (QSA) 的混合架构同时解决这两个问题。每四层中有三层使用 GDN,将历史上下文持续压缩为固定大小的循环状态,从而消除序列变长时 KV 缓存的增长。剩余层使用 QSA 在整个上下文中进行精确检索。

先前的稀疏注意力方法依赖于 token 级索引器,随着上下文长度增长,其计算成本越来越高。QSA 将序列聚合为微块,在块级别估计其重要性,并仅选择最相关的区域。这减少了每层内的注意力、计算和索引开销,使该设计非常适合在 GDN 和 QSA 层之间交替的架构。

阿里巴巴发布的基准测试表明,QSA 可以提高 100 万 token 工作负载的效率。与全注意力相比,其注意力内核在预填充阶段实现了高达 7.6 倍的加速,在解码阶段实现了 4.9 倍的加速。在 100 万 token 上下文长度90% 前缀缓存命中率的缓存密集型在线服务测试中,Qwen3.8-Flash-Next 实现了 Qwen3.7-Plus 预填充吞吐量的 8.6 倍

展示 GDN 和 QSA 与 MoE 如何减少大上下文推理的内存和计算的示意图。

图 1. Qwen3.8-Flash-Next 概览,展示三层 GDN 和一层 QSA 与 MoE 结合,以减少大上下文推理的内存和计算

视频 1. Qwen3.8-Flash-Next 诊断并修复一个 bug

在 NVIDIA GB300 NVL72 上运行 Qwen3.8-Flash-Next

GB300 NVL72 采用机架级架构,将 72 个 NVIDIA Blackwell Ultra GPU 集成到单一平台中。其大型的 72-GPU NVIDIA NVLink 域能够以 130 TB/s 的速度实现高效的全对全通信,消除了专家流量必须跨越传统现成网络时出现的瓶颈。在 NVIDIA GB300 NVL72 上运行可提供每 GPU 超过 16K token/秒每用户超过 200 token/秒的性能,使开发者能够以高吞吐量和低延迟实验智能体编码应用

展示 Qwen3.8-Flash-Next 在 NVIDIA GB300 NVL72 上使用 TensorRT-LLM 的 FP8 性能:吞吐量与交互性对比图。

图 2. 帕累托曲线显示 Qwen3.8-Flash-Next 在 NVIDIA GB300 NVL72 上实现每 GPU 每秒超过 16K tokens 的峰值吞吐量

除机架级部署外,Qwen3.8-Flash-Next 还可在本地 NVIDIA 硬件上运行,包括 NVIDIA DGX Station、NVIDIA DGX Spark 集群,以及配备四块 NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition GPU 的工作站。开发者可以在本地硬件上对智能体编码工作流进行原型设计和评估,并将同一模型扩展到 GB300 NVL72 用于生产服务。

对 Qwen3.8-Flash-Next 进行后训练,并使用你偏好的推理引擎进行服务

开发者可以使用 NVIDIA NeMo AutoModel 针对特定领域用例对模型进行微调,这是一个 PyTorch 原生的微调库,支持 Day-0 Hugging Face 检查点。可直接在现有检查点上训练,无需模型转换,并支持完整 SFT 或内存高效的 LoRA 微调。用户还可以进一步使用 NVIDIA NeMo RL 配方执行强化学习。

NVIDIA 支持多种推理栈以满足各类开发者需求。SGLangvLLMTokenSpeed 为需要在 NVIDIA 加速平台上对性能进行更强控制的开发者提供开源推理配方。

开始使用 Qwen3.8-Flash-Next

直接从 QwenCloud 试用该模型。

Hugging FaceModelScope 下载模型权重,并使用来自 NVIDIA NGC 的无模型 NVIDIA NIM 进行部署