精选

在 NVIDIA GB300 NVL72 上部署参数量达 2.4T 的 Qwen3.8-2.4T-A95B 模型,并支持可配置推理

阿里巴巴发布了其最大的开放权重模型 Qwen3.8-2.4 T-A95B (Qwen3.8-Max) 的开放权重,为开放生态系统带来了近乎前沿的功能。它的总参数为 2.4 T,每个 token 激活了 95B。它的总参数为 2.4 T,每个 token 激活了 95B。它是一种精细的混合专家 (MoE) 架构,混合了全注意力和线性注意力,上下文窗口多达 100 万个 token,输出长度高达 128K,专为要求苛刻的推理和代理式工作负载而设计。

部署 2.4 T 参数开放权重模型需要数据中心规模的加速计算。这种规模的推理依赖于跨芯片、系统架构和软件的极端协同设计。NVIDIA 正在与开源生态系统合作,通过优化的内核、推理运行时和分布式服务方案,将模型引入多节点部署。

无需额外的模型调优,该模型在首发日即可在 NVIDIA GB300 NVL72 上实现每个 GPU 每秒超过 4K token 的吞吐量,并在 FP8 精度下达到每位用户每秒超过 350 个 token。进一步的优化 (包括 NVFP4 精度) 有望随着时间的推移带来更高的性能提升。

用于长上下文推理的架构创新

Qwen3.8-2.4 T-A95B 专为最难的代理式工作负载而构建,例如编码、大规模文档分析和长时间运行的多步骤工作流。与发送单个提示并接收单个回复的聊天优先模型不同,代理式应用会在整个工作流中累积系统指令、工具输出、检索到的文档、代码、日志和多步骤推理痕迹。随着上下文的发展,注意力、计算和 KV 缓存成为绑定限制。

全注意力和线性注意力混合架构解决了这一问题,模型在两者之间交替运行。在全注意力层中,每个 token 关注所有其他 token,而在线性注意力层中,不断增长的 KV 缓存被替换为有界循环状态。当上下文扩展到多达 100 万个 token 时,Qwen3.8-2.4 T-A95B 会保持计算和内存的边界。

细粒度 MoE 使 2.4 T 参数计数变得切实可行。容量分配给更多的小型专家,而不是少数大型专家,从而提高每单位激活计算的专业化和路由效率。学习到的路由器仅激活每个 token 所需的专家,因此服务成本会跟踪活动参数,而不是完整的 2.4 T 参数,从而以类似稠密模型的一小部分成本提供前沿规模的容量。

内置推理控制 (低/ 高/ 高) 使开发者能够为每个请求配置推理深度,并根据任务以算力换取推理质量:拨打电话进行复杂的多步骤推理,或向下拨打电话进行高吞吐量文档处理。

Qwen3.8-2.4 T-A95B 在 GB300 NVL72 上的优化性能

GB300 NVL72 采用机架级架构,将 72 块 NVIDIA Blackwell Ultra GPU 集成到单个平台中。其 72-GPU 的大型 NVIDIA NVLink 域能够以 130 TB/s 的速度实现高效的多对多通信,消除了专家流量必须通过传统现有网络时出现的瓶颈。

在 NVIDIA Blackwell GB300 NVL72 上运行的 Qwen3.82.4 T-A95B 开箱即用,每个 GPU 每秒可提供超过 4K token,每个用户每秒可提供超过 350 个 token,使 AI 工厂能够在生产中以高吞吐量和低延迟运行大参数模型。

后训练 Qwen3.8-2.4 T-A95B 并选择发球路径

NVIDIA 支持多个推理堆栈,可满足开发者的各种需求。SGLangvLLMNVIDIA Dynamo 为需要在 NVIDIA 加速平台上更好地控制性能的开发者提供开源推理方案。

它还可以通过无模型的 NVIDIA NIM进行部署,NVIDIA NIM 是为任何受支持的模型提供服务的单一推理容器。下载模型权重,并在首发日进行部署,以提供经过微调的检查点,并扩展到生产环境。

开发者可以使用 NVIDIA NeMo AutoModel (一个支持 Day-0 Hugging Face 检查点的 PyTorch 原生微调库) 针对特定领域的用例对模型进行后期训练。直接在现有检查点上训练,无需模型转换,支持完整的 SFT 或内存高效的 LoRA 微调。

开始使用 Qwen3.8-2.4 T-A95B

Hugging FaceModelScope 下载 Qwen3.8-2.4 T-A95B 模型权重,并使用 无模型 NVIDIA NIM 进行部署。

标签