精选

在 NVIDIA GB300 NVL72 上进行 MoE 预训练创下世界纪录

前沿模型预训练已融合多专家模型 (MoE) ,这从根本上改变了对大规模 AI 训练的限制。随着每 token 的计算量下降,通信越来越多地决定模型在数千个 GPU 上的扩展效率。NVIDIA GB300 NVL72 创造了预训练 DeepSeek-V3 671B 的世界纪录,每个 GPU 可达到 1648 TFLOPS,这表明从芯片到网络再到软件,整个 AI 平台的进步如何继续推动训练性能的提升。预训练效率的每一次提升都意味着研究人员可以在相同的 NVIDIA 基础架构上训练更大的模型、运行更多的实验,并更快地达到前沿能力。  

这些 MoE 架构的巨大计算效率推动着行业向这些架构的快速转变。与稠密模型不同,每个 token 都会激活每个参数,并且每个 token 的计算量会随着总参数数量的增加而增加,MoE 模型会为每个 token 激活一个参数子集。例如,DeepSeek-V3 拥有 6710 亿个参数,但每个 token 仅激活大约 370 亿个参数,以更小的模型的每个 token 成本达到前沿规模。

需要权衡沟通。这些专家位于其他 GPU 上,因此每个 MoE 层都必须将每个 token 发送给其专家,并通过向前和向后传递的 all-to-all 通信模式收集结果。这种集合位于关键路径上,使得吞吐量与计算一样依赖于通信。由于这种情况发生在每个训练步骤的每一层,因此微小的延迟会加剧,直到 all-to-all 无法再隐藏在计算背后,而且添加 GPU 不会再增加吞吐量。

正因如此,预训练需要一个紧密合的可扩展域,其中每个 GPU 都可以通过无阻塞结构与每个其他 GPU 进行通信,从而随着域的增长提供高、统一的带宽、低延迟和完整的对分带宽。训练这种规模的模型需要的 GPU 数量超过单个域所能容纳的数量,并且必须将多个域关联在一起。这种横向扩展流量较轻,频率较低,但它仍然必须在计算窗口内完成并保持可预测性,因此没有一个慢速链路控制步骤。我们面临双重挑战,衡量成功的标准是交付的浮点运算数,而不是峰值浮点运算数。

NVIDIA GB300 NVL72:专为紧密合的 AI 预训练而构建

双重通信挑战需要围绕它设计系统,而不仅仅是速度更快的芯片。计算、纵向扩展互连、横向扩展网络、基础设施处理和软件各自承担部分负载。任何一方的短缺都会影响整体发展。GB300 NVL72 是一个通过极端协同设计构建的机架级系统,将芯片、互连、网络和软件设计为一个平台,而不是从部件中组装,从而共同应对这些挑战。 

其核心是 NVIDIA NVLink,这种纵向扩展结构使 72 块 NVIDIA Blackwell Ultra GPU 成为一体。第五代 NVLink 为每个 GPU 提供 1.8 TB/s 的带宽,并在整个机架中提供 130 TB/s 的无阻塞、多对多的带宽,因此每个 GPU 只需一个跃点即可相互连接。 

宽度只是其中的一半,路径就是其余部分。NVLink 具有内存语义:GPU 在无损、流控制的结构上直接读取和写入同行的 HBM,作为原生加载和存储操作。传输是硬件内存操作,而不是软件发送,因此数据路径中的任何内容都不会增加延迟,并且当数据流通过时,减少可以在交换机内部运行。 

这正是每层流量的需求:张量并行 all-reduce 和 MoE all-to-all 都保留在机架内,具有全带宽和低延迟。除了机架之外,该平台还通过 NVIDIA ConnectX-8 SuperNIC 进行扩展,每个 GPU 的速度为 800 Gbps,并采用 NVIDIA Quantum-X800 InfiniBandNVIDIA Spectrum-X 以太网,以确保计算背后隐藏的梯度流量。 

协同设计已从训练结构扩展到基础设施服务和软件。在生产级 AI 工厂中,NVIDIA BlueField 数据处理器 (DPU) 为虚拟网络、存储访问、安全、遥测和生命周期管理提供了一个隔离的基础设施处理域,从而减少了大规模训练作业的主机 CPU 开销。

训练软件涵盖了生态系统的方方面面。NVIDIA Megatron Core 专为这些 GPU 构建和调整。NVIDIA 还积极为开源框架做出贡献,以确保 TorchTitan 和 JAX 在 GB300 NVL72 系统上全速运行。

使用 Megatron Core 实现出色的预训练性能  

在使用 256 个 GPU 的 DeepSeek-V3 671B 模型上,Megatron Core 在 GB300 NVL72 上的每个 GPU 可达到 1648 TFLOPS,而在之前的 GB200 NVL72 结果中,每个 GPU 的吞吐量为 606 TFLOPS,在单代中每个 GPU 的交付吞吐量提高了 3 倍。 

NVIDIA 继续优化其软件,以提高整个平台的性能。在预训练工作负载中,DeepSeek-v3 671B 的大小会复合增加。在相同的 GB300 NVL72 机架级系统上,在软件改进的推动下,性能在六个月内提高了 1.5 倍。这表明,在芯片出厂后,原始性能和训练吞吐量会继续大幅提升。 

由 NVIDIA 加速的领先预训练框架  

NVIDIA 工程师直接为 AI 社区所依赖的开放框架做出贡献,并添加优化,使其在 NVIDIA GPU 上更快地运行。这些技术由 NVIDIA 与 PyTorch 和 JAX 社区共同开发,能够不断提升性能。

TorchTitan 是 PyTorch 的原生训练堆栈,NVIDIA 在 GB300 NVL72 上不断提升其性能。在 DeepSeek-V3 671B 上,这些优化可以在同一基础架构上提供约 6 倍的交付性能。

JAX 也遵循相同的思路。在过去六个月的时间里,NVIDIA JAX 优化使 DeepSeek-V3 671B 在 256 个 GPU 规模下的性能提升了近 10 倍,而这一切都得益于软件优化。最新的软件版本达到了 1025 TFLOPS/ GPU 的卓越性能吞吐量,软件优化也在不断发展。  

通过将 DeepSeek-V3 671B 预训练从 256 个 GPU 扩展到 1024 个 GPU,Megatron Core 可提供 98.5% 的每个 GPU 性能,而 TorchTitan 和 JAX 各提供 97% 的性能,因此几乎所有新增的基础设施都能转化为每秒新增的系统级令牌吞吐量。这种效率是横向扩展网络高效地完成工作,因为机架以每个 GPU 800 Gb/s 的速度进行横向扩展;梯度流量始终隐藏在计算背后,确保增加更多 GPU 会严格增加系统总吞吐量,而不是因通信开销而使网络陷入困境。 

创造世界纪录

借助 GB300 NVL72,使用 256 个 GPU 对 DeepSeek-v3 671B 进行预训练的每个 GPU 可实现 1648 TFLOPS 的世界纪录,使相同的训练工作能够以低于上一代的硬件达到相同的性能。 

开放式框架同样适用于此。随着软件的发展,在同一个平台上,性能会不断提升。这些结果并不是天方夜,它们来自一个平台,其硬件、互连和软件在一起设计并不断优化。当今创纪录的性能只是未来更高性能的基础。 

开始在 NVIDIA AI 基础架构上训练前沿模型

致谢

通过预训练 DeepSeek-V3 模型,在 NVIDIA GB300 NVL72 平台上创造了世界纪录,这反映了整个公司许多杰出工程师的工作成果。我们感谢以下人士 (按姓氏排序) 做出的贡献:

Aidyn Aitjan、Michael Andersch、Jan Bernloehr、Santosh Bhavani、Ben Cashman、Carlo del Mundo、Ashraf Eassa、Fabio Paes Leme Ferriani、Matt Frank、Abhinav Goel、Vivek Goel、Elfie Guo、Eric Harper、Munira Hussain、Tomasz Jakubek、Masaki Kozuki、George Kurian、Himangshu Lahkar、Guihong Li、Kibibibi Moseley、Nitin Nitin、Devin O’Kelly、Christian M. Sarofeen、Priya Sethuraman、Tejash Shah、Franciszek Szarwacki、John Tran、Qiyu Wan、和 Cliff Woolley。

标签