Choose a model for the work you need to doMe
← All case studies

阿里巴巴发布了 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构的预览版,供开发者进行实验和评估

Article content is shown in its original language.

阿里巴巴发布了 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构的预览版,供开发者进行实验和评估。Qwen4 是一款多模态混合专家 (MoE) 模型,其主模型包含 1250 亿个参数,并辅以 510 亿个 N-gram 嵌入,每个词元激活 60 亿个参数。它原生支持 262,144 个词元的上下文窗口,并可通过 YaRN 扩展到 100 万个词元。

NVIDIA 通过 SGLang、vLLM 和 NVIDIA TensorRT LLM 提供尽力而为的 Day 0 功能支持,在 NVIDIA GB300 NVL72 上进行推理验证,并提供来自 NVIDIA NeMo AutoModel 和 NVIDIA NeMo RL 的训练后配方。

用于长远语境推理的建筑创新

Qwen3.8-Flash-Next 专为高容量、上下文密集型应用而设计,例如智能体编码、文档处理和工具驱动的工作流。随着上下文的增长,注意力计算和键值缓存内存会成为瓶颈。该模型采用混合架构,结合了 门控 DeltaNet (GDN) 和 Qwen 稀疏注意力 (QSA) ,从而解决了这两个问题。每四层中就有三层使用 GDN 将历史上下文持续压缩到固定大小的循环状态,从而消除序列长度增加时键值缓存的增长。剩余的一层则使用 QSA 在整个上下文中进行精确检索。

以往的稀疏注意力机制依赖于词元级索引器,随着上下文长度的增长,其计算成本会越来越高。QSA 将序列聚合成微块,估计每个微块的重要性,并仅选择最相关的区域。这降低了每一层的注意力、计算和索引开销,使得该设计非常适合在 GDN 层和 QSA 层之间交替的架构。

阿里巴巴 公布的基准测试表明,QSA 可以提升 百万级令牌工作负载 的效率 。与完全注意力机制相比,其注意力内核在预填充阶段速度提升高达 7.6 倍在解码阶段速度提升高达 4.9 倍 。在缓存密集型在线服务测试中, 上下文长度为百万级令牌前缀缓存命中率为 90% ,Qwen3.8-Flash-Next 的 预填充吞吐量是 Qwen3.7-Plus 的 8.6 倍

图示展示了 GDN 和 QSA 与 MoE 如何减少大上下文推理的内存和计算量。

图 1. Qwen3.8-Flash-Next 概览,展示了三层 GDN 和一层 QSA,并采用 MoE 技术来减少大上下文推理的内存和计算量。

视频 1. Qwen3.8-Flash-Next 诊断并修复一个错误

在 NVIDIA GB300 NVL72 上运行 Qwen3.8-Flash-Next

GB300 NVL72 采用机架级架构,将 72 个 NVIDIA Blackwell Ultra GPU 集成到单个平台中。其庞大的 72 GPU NVIDIA NVLink 域可实现高达 130 TB/s 的高效全连接通信,从而消除专家流量必须通过传统现成网络传输时出现的瓶颈。NVIDIA GB300 NVL72 可为每个 GPU 提供 每秒超过 16,000 个令牌的处理能力 ,为每个用户提供每秒超过 200 个令牌的处理能力, 使开发人员能够以高吞吐量和低延迟的方式进行代理编码应用程序的实验。

图表显示了 Qwen3.8-Flash-Next FP8 在 NVIDIA GB300 NVL72 上的吞吐量与使用 TensorRT-LLM 的交互性的性能。

图 2. Pareto 曲线显示 Qwen3.8-Flash-Next 在 NVIDIA GB300 NVL72 上每个 GPU 的峰值吞吐量超过每秒 16K 个令牌。

除了机架级部署之外,Qwen3.8-Flash-Next 还可在本地 NVIDIA 硬件上运行,包括 NVIDIA DGX Station、NVIDIA DGX Spark 集群以及配备四块 NVIDIA RTX PRO 6000 Blackwell Max-Q 工作站版 GPU 的工作站。开发人员可以在本地硬件上构建和评估代理编码工作流程的原型,并将同一模型扩展到 GB300 NVL72 以用于生产环境。

将训练后的 Qwen3.8-Flash-Next 部署到您首选的推理引擎中。

开发者可以使用NVIDIA NeMo AutoModel 对特定领域的应用场景进行模型微调。NVIDIA NeMo AutoModel 是一个原生于 PyTorch 的微调库,支持 Day-0 Hugging Face 检查点。无需模型转换,即可直接在现有检查点上进行训练,并支持完整的 SFT 或内存高效的 LoRa 微调。用户还可以使用 NVIDIA NeMo RL 配方 进一步执行强化学习 。

NVIDIA 支持多种推理堆栈, 以满足开发者的各种需求。SGLang 、 vLLMTokenSpeed 为需要在 NVIDIA 加速平台上更好地控制性能的开发者提供了开源的推理方案。

开始使用 Qwen3.8-Flash-Next

直接在 QwenCloud 上试用该模型

从Hugging FaceModelScope 下载模型权重 ,并 使用 NVIDIA NGC 中的 无模型 NVIDIA NIM 进行部署。

Copyright removal requests

This article shares an AI use case. Rights to the original text and materials belong to their authors. Contact us to request removal of infringing content.

Contact email:jadename.zhou@gmail.com
Explore moreOther case studiescase studies →