精选

在 NVIDIA GB300 NVL72 上使用 Qwen3.8-Flash-Next 进行代理式编码实验

阿里巴巴发布了 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构的预览,供开发者试验和评估。这是一种多模态混合专家 (MoE) 模型,具有 125B 参数的主模型,并由额外的 51B N-gram 嵌入加以补充,每个 token 可激活 60 亿个参数。它具有原生的 262144 令牌上下文窗口,可通过 YaRN 扩展到 100 万个令牌。

NVIDIA 通过 SGLang、vLLM 和 NVIDIA TensorRT LLM 提供尽力而为的 Day 0 功能支持,并通过 NVIDIA GB300 NVL72 提供推理验证,以及 NVIDIA NeMo AutoModel 和 NVIDIA NeMo RL 的后训练方法。

用于长上下文推理的架构创新

Qwen3.8-Flash-Next 专为大量上下文密集型应用程序而设计,例如代理式编码、文档处理和工具驱动的工作流。随着上下文的发展,注意力计算和 KV 缓存内存成为瓶颈。该模型通过结合门控 DeltaNet (GDN)Qwen 稀疏注意力 (QSA) 的混合架构来解决这两种问题。每 4 层中就有 3 层使用 GDN 将历史上下文持续压缩为固定大小的循环状态,从而避免 KV 缓存随着序列延长而增长。剩余层使用 QSA 在整个上下文中进行精确检索。

先前的稀疏注意力方法依赖于标记级索引器,随着上下文长度的增加,这些索引器的计算成本也会越来越高。QSA 会将序列聚合为微块,在块级别估算其重要性,并仅选择最相关的区域。这会减少每层内的注意力、计算和索引开销,使设计非常适合 GDN 层和 QSA 层之间交替使用的架构。

阿里巴巴发布的基准测试表明,QSA 可以提高 100 万个 token 的工作负载的效率。与全注意力模式相比,其注意力内核在预填充和解码过程中的速度分别提高了 7.6 倍4.9 倍。在缓存密集型在线服务测试中,Qwen3.8-Flash-Next 的上下文长度为 100 万 token,且前缀缓存命中率为 90%,其预填充吞吐量是 Qwen3.7-Plus8.6 倍

在 NVIDIA GB300 NVL72 上运行 Qwen3.8-Flash-Next

GB300 NVL72 采用机架级架构,将 72 块 NVIDIA Blackwell Ultra GPU 集成到单个平台中。其 72-GPU 的大型 NVIDIA NVLink 域能够以 130 TB/s 的速度实现高效的多对多通信,消除了专家流量必须通过传统现有网络时出现的瓶颈。在 NVIDIA GB300 NVL72 上运行,每个 GPU 每秒可提供超过1.6 万个 token,每个用户每秒可提供超过200个 token,使开发者能够以高吞吐量和低延迟试验代理式编码应用。

除了机架级部署,Qwen3.8-Flash-Next 还可在本地 NVIDIA 硬件上运行,包括 NVIDIA DGX 工作站、NVIDIA DGX Spark 集群,以及配备四个 NVIDIA RTX PRO Blackwell Max-Q 工作站版 GPU 的工作站。开发者可以在本地硬件上对代理式编码工作流进行原型设计和评估,并将同一模型扩展到 GB300 NVL72 以提供生产服务。

对 Qwen3.8-Flash-Next 进行后训练,并使用您首选的推理引擎为其提供服务

开发者可以使用 NVIDIA NeMo AutoModel (一个支持 Day-0 Hugging Face Checkpoint 的 PyTorch 原生微调库) 针对特定领域的用例微调模型。直接在现有检查点上训练,无需模型转换,支持完整的 SFT 或内存高效的 LoRA 微调。用户可以一步一步地使用 NVIDIA NeMo RL 方法执行强化学习。

NVIDIA 支持多个推理堆栈,可满足开发者的各种需求。SGLangvLLMTokenSpeed 为需要在 NVIDIA 加速平台上更好地控制性能的开发者提供开源推理方案。

开始使用 Qwen3.8-Flash-Next

试用 QwenCloud 中的模型。

Hugging FaceModelScope 下载模型权重。

标签