阿里巴巴发布了 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构的预览版,供开发者进行实验和评估。这是一个多模态混合专家(MoE)模型,主模型拥有 1250 亿参数,并额外补充了 510 亿参数的 N-gram 嵌入,每个 token 激活 60 亿参数。它具有原生的 262,144 token 上下文窗口,可通过 YaRN 扩展至 100 万 token。
NVIDIA 通过 SGLang、vLLM 和 NVIDIA TensorRT LLM 提供尽力而为的 Day 0 功能支持,在 NVIDIA GB300 NVL72 上进行推理验证,并提供来自 NVIDIA NeMo AutoModel 和 NVIDIA NeMo RL 的后训练配方。
面向长上下文推理的架构创新
Qwen3.8-Flash-Next 专为高容量、上下文密集型应用而设计,例如智能体编码、文档处理和工具驱动的工作流。随着上下文增长,注意力计算和 KV 缓存内存成为瓶颈。该模型通过结合 Gated DeltaNet (GDN) 和 Qwen Sparse Attention (QSA) 的混合架构同时解决这两个问题。每四层中有三层使用 GDN,将历史上下文持续压缩为固定大小的循环状态,从而消除序列变长时 KV 缓存的增长。剩余层使用 QSA 在整个上下文中进行精确检索。
先前的稀疏注意力方法依赖于 token 级索引器,随着上下文长度增长,其计算成本越来越高。QSA 将序列聚合为微块,在块级别估计其重要性,并仅选择最相关的区域。这减少了每层内的注意力、计算和索引开销,使该设计非常适合在 GDN 和 QSA 层之间交替的架构。
阿里巴巴发布的基准测试表明,QSA 可以提高 100 万 token 工作负载的效率。与全注意力相比,其注意力内核在预填充阶段实现了高达 7.6 倍的加速,在解码阶段实现了 4.9 倍的加速。在 100 万 token 上下文长度和 90% 前缀缓存命中率的缓存密集型在线服务测试中,Qwen3.8-Flash-Next 实现了 Qwen3.7-Plus 预填充吞吐量的 8.6 倍。

图 1. Qwen3.8-Flash-Next 概览,展示三层 GDN 和一层 QSA 与 MoE 结合,以减少大上下文推理的内存和计算
视频 1. Qwen3.8-Flash-Next 诊断并修复一个 bug
在 NVIDIA GB300 NVL72 上运行 Qwen3.8-Flash-Next
GB300 NVL72 采用机架级架构,将 72 个 NVIDIA Blackwell Ultra GPU 集成到单一平台中。其大型的 72-GPU NVIDIA NVLink 域能够以 130 TB/s 的速度实现高效的全对全通信,消除了专家流量必须跨越传统现成网络时出现的瓶颈。在 NVIDIA GB300 NVL72 上运行可提供每 GPU 超过 16K token/秒和每用户超过 200 token/秒的性能,使开发者能够以高吞吐量和低延迟实验智能体编码应用。

图 2. 帕累托曲线显示 Qwen3.8-Flash-Next 在 NVIDIA GB300 NVL72 上实现每 GPU 每秒超过 16K tokens 的峰值吞吐量
除机架级部署外,Qwen3.8-Flash-Next 还可在本地 NVIDIA 硬件上运行,包括 NVIDIA DGX Station、NVIDIA DGX Spark 集群,以及配备四块 NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition GPU 的工作站。开发者可以在本地硬件上对智能体编码工作流进行原型设计和评估,并将同一模型扩展到 GB300 NVL72 用于生产服务。
对 Qwen3.8-Flash-Next 进行后训练,并使用你偏好的推理引擎进行服务
开发者可以使用 NVIDIA NeMo AutoModel 针对特定领域用例对模型进行微调,这是一个 PyTorch 原生的微调库,支持 Day-0 Hugging Face 检查点。可直接在现有检查点上训练,无需模型转换,并支持完整 SFT 或内存高效的 LoRA 微调。用户还可以进一步使用 NVIDIA NeMo RL 配方执行强化学习。
NVIDIA 支持多种推理栈以满足各类开发者需求。SGLang、vLLM 和 TokenSpeed 为需要在 NVIDIA 加速平台上对性能进行更强控制的开发者提供开源推理配方。
开始使用 Qwen3.8-Flash-Next
直接从 QwenCloud 试用该模型。
从 Hugging Face 或 ModelScope 下载模型权重,并使用来自 NVIDIA NGC 的无模型 NVIDIA NIM 进行部署。
