智能体/生成式 AI

NVIDIA NVLink:适用于 AI 工厂的纵向扩展网络

对 AI 的需求持续加速。工作负载变得越来越大,模型变得越来越复杂,并且以前所未有的速度部署 AI 计算基础设施的压力越来越大。AI 工厂是数据中心规模的系统,可持续将数据和能源转化为智能,以满足这种永无止境的需求。

这种面向数据中心的 AI 工厂方法从根本上改变了系统设计和运营。加速器 FLOPS 峰值已无法满足需求。当今的 AI 工作负载,包括万亿参数模型、多专家模型 (MoE) 架构、长上下文推理和分解服务,需要多个加速器作为单个计算单元协同工作。实现这一目标需要高带宽、低延迟的 GPU 到 GPU 通信、集合网络的快速网络计算以及软件感知调度。

考虑到组件数量众多,需要在整个数据中心中建立弹性。跟上 AI 的步伐需要能够跟上行业创新速度的技术和供应链。

因此,纵向扩展网络已成为 AI 工厂中最重要的架构决策之一。纵向扩展结构使加速器能够作为单个计算单元运行,从而确定 token 在专家之间的移动效率、集合操作完成的速度以及工厂可以提供的有用吞吐量。这是运营商在部署新平台时承担多大风险的重要因素。

NVIDIA NVLink 是专为 AI 工厂打造的纵向扩展网络结构。它旨在加速 AI 推理、训练和其他需要大规模、快速 GPU 到 GPU 通信的并行计算工作负载。采用 NVLink 6 交换机的第六代 NVLink 互连技术可为纵向扩展网络提供更高的 GPU 到 GPU 带宽和更低的延迟 all-to-all 拓扑,并支持 SHARP 网络计算来卸载集合运算。它还包括专为生产 AI 工厂正常运行时间设计的机架级弹性功能。

NVLink 通过极致的协同设计开发,从芯片到系统、网络和软件的整个堆栈都是一起设计和优化的,是 NVIDIA 年度 AI 基础设施路线图节奏的一部分。这种成熟、成熟且广泛部署的技术构成了现代 AI 基础设施的支柱。

纵向扩展网络如何决定 AI 工厂的经济性

横向扩展网络连接整个数据中心的服务器。纵向扩展网络使域内的 GPU 能够充当单一计算引擎。两者都必不可少,但它们可以解决不同的问题。

NVIDIA Quantum InfiniBand 和 NVIDIA Spectrum-X 以太网等横向扩展网络可实现跨越数千到数十万个 GPU 的大型集群。这对于大型数据并行 AI 训练工作负载 (以及大规模科学模拟) 至关重要。纵向扩展网络通过高带宽、可预测的低延迟和共享的高带宽内存 (HBM) ,在单个域中连接加速器。对于现代 AI 训练和推理而言,大多数延迟敏感型通信模式出现在纵向扩展领域。

我们来看看使用 MoE 模型进行推理的示例。

高效的推理实现使用专家并行在GPU之间分配专家,并使用大批量来更大限度地提高工厂吞吐量。这可并行处理工作负载,但会在GPU之间创建密集的多对多通信。Token必须发送给选定的专家,进行处理、收集、重新排序并向前传递。

所有 GPU 到 GPU 的通信必须并行进行。如果专家采用低带宽或高延迟网络,则通信开销会抵消专家并行性带来的收益。在训练 MoE 模型时也会出现同样的现象。

要点在于,all-to-all 带宽和延迟对于 AI 工厂性能至关重要。AI 工厂需要与系统的其他部分共同设计专用的纵向扩展网络,以便在负载情况下跨所有工作负载提供和维护这些功能。纵向扩展网络通过优化每瓦特、每美元和每工厂平方英尺的交付令牌来提高投资回报率。这有助于缩短 AI 工厂的训练时间、提高利用率并降低每个 token 的成本。

NVIDIA 已经证明了高带宽、低延迟纵向扩展网络在大规模 MoE 中的影响。对于 DeepSeek-R1 和 Qwen 235B 等模型以及模拟的 2T 参数 LLM,与领先的 OTS 以太网相比,NVLink 可提供高达 2.3 倍的解码吞吐量。

评估纵向扩展技术

规格表通常使用简单的带宽编号 (链路速率、交换机总容量或每个设备的标题带宽) 来比较网络。这些数字很有用,但还不够。

要评估当今 AI 工作负载的纵向扩展功能,需要从工厂层面进行分析。交付的全系统性能决定了每个单位时间、功耗和工厂占地面积可以处理和生产的 token 数量。这取决于多对多网络带宽、端到端延迟 (即从每个 GPU 的 HBM 内存到网络到其他 GPU 的 HBM 内存的延迟) 、用于归约的网络计算和其他群集。它还需要在各个级别完全集成的软件,以便优化路由、公开集合、平衡链路流量和管道数据传输,并完全支持当今 AI 工作负载使用的库和框架。

提供的性能只有在工厂正常运营的情况下才重要。能够长时间运行而无故障,持续监控系统运行状况,并在工厂其余部分继续运营时支持组件级别的服务和维护,将交付的性能转化为良好的性能,即工厂在整个生命周期内的生产能力。

通过一项复杂的技术在许多工作负载中实现最佳的交付性能和良好的输出是一项非常艰巨的挑战,多年来,我们通过广泛部署的纵向扩展基础设施和强大的供应链来学习来解决这一挑战。使用未经验证的技术堆栈或并非专为纵向扩展网络而构建的解决方案会带来工厂性能欠佳、中断停机事件和供应不可靠的风险。

这些指标共同推动了唯一重要的结果:在 AI 工厂的整个生命周期内实现持续、可靠的投资回报率。

AI 工厂纵向扩展网络的关键指标

提供的性能 出厂恢复能力 平台成熟度和成熟的供应链
为当今的 AI 工作负载提供的工厂性能始于带宽和延迟,但还包括端到端纵向扩展网络性能、用于归约和其他群集的网络计算,以及集成到解决方案每个部分的成熟全栈软件实施。 将提供的性能转化为良好的输出需要系统级的弹性,包括长时间正常运行、持续的系统运行状况监控和遥测,以及组件级别的服务和维护支持,而工厂的其余部分则继续运行。 扩展 AI 工厂是一项极其复杂的挑战,且依赖项众多。运营商希望利用成熟的技术堆栈,在大规模部署和实现投资回报率方面拥有经过验证的扩展跟踪记录,从而更大限度地降低风险。
表 1. 这三个关键指标对于评估纵向扩展网络解决方案至关重要。  

NVLink 现已推出第六代,可提供更大限度提高工厂产出所需的性能和弹性,并经过十多年的技术投资和成熟部署,包括世界领先的超大规模企业、云服务提供商 (CSP) 和超级计算中心。

出色的性能

借助 Vera Rubin NVL72,第六代 NVLink 可在 72 GPU 域中为每个 GPU 提供 3.6 TB/s 的 GPU 到 GPU 双向带宽和 260 TB/s 的机架级 GPU 带宽。与基于现有以太网的替代解决方案相比,GPU 到 GPU 传输的端到端延迟低 3 倍,数据包速率高 10 倍。

3X
Lower latency

10X
Higher packet rate

130 TFLOPS
In-network compute

与基于现成以太网的替代解决方案相比,第六代 NVLink 可为 GPU 到 GPU 传输提供更低的延迟和更高的数据包速率,并提供用于集合运算的网络计算能力

NVLink Switch 托盘和由 5000 根线缆组成的 NVLink Spine 构成了单一的 all-to-all 拓扑结构,因此任何 GPU 都可以与任何其他 GPU 以统一的延迟和带宽进行通信。每个托盘包含四个 NVLink 6 交换芯片、28.8 TB/s 的托盘总带宽和 14.4 TFLOPS 的 FP8 网络计算能力。在单个 Vera Rubin NVL72 机架中,NVLink 6 可提供 260 TB/s 的聚合带宽和 130 TFLOPS 的网络计算能力,用于加速归约和其他聚合运算 (例如。all-reduce、reduce、broadcast 等) 。

NVLink 技术路线图包括支持将域大小扩展至 1152 个 GPU,并通过光电一体封装的光学元件实现连接。

软件是纵向扩展网络堆栈的关键组成部分,包括NVIDIA Dynamo、NVIDIA TensorRT-LLM、NVIDIA 集合通信库 (NCCL) 等 (在关于平台成熟度的部分中进行了详细讨论) ,所有这些软件都建立在NVIDIA CUDA 之上,NVIDIA CUDA 是全球领先的并行计算平台,于近 20 年前首次发布

硬件和软件均采用极致协同设计进行开发。这会导致性能加速,而这是通过孤立的堆栈元素无法实现的。对于当今的 AI 工作负载,这直接转化为基础设施经济学。

例如,在从 NVIDIA Hopper 到 NVIDIA Blackwell 的过渡中,包括将 NVLink 带宽翻倍、将 NVLink 纵向扩展域的大小从 8 个 GPU 扩展到 72 个,以及整合 Dynamo 进行解推理,NVIDIA 将 MoE 每瓦推理性能提高了 50 倍。

NVIDIA Vera Rubin 平台通过将 NVLink 带宽和网络计算能力翻倍,进一步扩展了这一点。

随着模型架构的发展,硬件结构和软件通信堆栈会一起发展。这种极致的协同设计开发方法需要整个堆栈之间的紧密协作。采用孤立的开发方法进行复制是不可行的,尤其是在超大规模部署压力下,但这是仅添加加速器与扩展到有用的交付性能之间的区别。

专为高速 以及 打造智能弹性

AI 工厂必须持续运行。随着机架越来越密集且越来越有价值,可维护性和故障管理成为性能方程的一部分。提供高带宽但需要进行破坏性维护的网络可能会降低有效容量和收入。

NVLink 6 引入了专为 AI 工厂运营设计的管理和智能弹性功能。这些功能可简化机架维护,让您更深入地了解组件性能和负载均衡,即使单个节点需要服务或更新,也能保持工厂正常运行。

第六代 NVLink Switch 支持智能弹性功能,可更大限度地延长正常运行时间并提高产量:

  • 控制平面弹性
  • 支持部分机架的操作
  • 可热插拔开关托盘
  • 具有管理控制器后备功能的软件定义路由
  • 动态流量重路由
  • 在线软件更新
  • 用于监控和故障归属的经过精细训练的链路遥测

这些功能并非次要功能。在生产 AI 工厂中,链路、交换机、托盘或管理控制器发生故障时,不应迫使整个机架停止服务。运营商需要与基础设施的经济价值相匹配的故障隔离、遥测和服务程序。NVLink 6 将纵向扩展网络引入与 AI 工厂堆栈其余部分相同的运营规则中。

成熟技术飞速发展

强大的技术策略将成熟度与速度相结合。NVLink 两者兼有。

NVLink 现已推出第六代专用纵向扩展网络结构。近十年来,NVIDIA 一直在大规模地进行生产部署,数百万 NVIDIA 芯片已部署在支持 NVLink 的系统以及由服务器、机架、线缆、交换机、软件和操作工具组成的生态系统中。

NVIDIA 年度平台 Cadence 提供了与 AI 创新步伐同步的新硬件功能,使行业能够快速部署新的模型和工作流,以满足全球的 AI 需求。

除了硬件之外,NVIDIA 和社区还发布了软件,作为纵向扩展网络堆栈的关键组件。其中包括:

  • Dynamo: 用于在多节点 GPU 环境中扩展生成式 AI 和推理模型的开源框架,具有解服务、动态 GPU 分配、KV-cache 感知路由和基于 NIXL 的数据移动。
  • TensorRT-LLM用于在 NVIDIA GPU 上进行高性能 LLM 推理的开源 NVIDIA 库,使用优化的内核、计算/通信重叠以及 NVFP4 和 FP8 等低精度格式,以提高 MoE 模型等的吞吐量。
  • NIXL: NIXL:开源 NVIDIA 库,用于跨 GPU 显存、CPU 显存、NVMe 和远程存储进行快速数据传输,帮助在分布式系统中高效移动 KV 缓存和推理状态。
  • NCCL:用于高速 GPU 通信的开放 NVIDIA 库,拥有超过 10 年的开源创新经验。包括拓扑感知群集、AI 框架集成,以及对网络内归约和其他群集的 SHARP 支持。
  • 结构和内存管理:包括地址空间管理 API、可扩展内存语义和内置内存一致性,可实现高效的 HBM 访问。

软件创新在硬件发布后仍会持续很长时间,从而在产品的整个生命周期内实现 X 倍加速。

AI 工厂需要的不仅仅是 GPU 到 GPU 的带宽。他们还需要高带宽、一致的 CPU-GPU 连接,以用于编排、数据传输、内存管理、存储服务和混合计算阶段的代理式工作负载。

NVIDIA NVLink-C2C 提供了该路径。借助 Vera Rubin NVL72 平台中的 Vera CPU,NVLink-C2C 可在 CPU 和 GPU 之间提供 1.8 TB/s 的一致性带宽,是 PCIe Gen6 带宽的 7 倍。这可实现高速数据共享,以及跨 CPU 和 GPU 显存的统一一致内存架构。对于基础架构团队而言,这意味着控制、内存和计算之间的瓶颈更少。对于软件团队而言,它可以简化编程模型,并支持 KV-cache 卸载、多模型执行、数据处理和代理式编排等工作负载。

Vera 本身就是为此角色而设计的,具有 88 个 NVIDIA 定制 Olympus 核心、高内存带宽,以及适用于 AI 工厂工作负载的节能高效操作。在 NVIDIA 平台中,CPU、GPU、NVLink、HBM、系统内存、网络和软件经过共同设计,可优化性能。

超大规模企业和 AI 原生企业为目标工作负载构建专用芯片,并为客户提供多种选择,但在部署这些芯片时,他们面临着一些挑战。集成最先进的纵向扩展网络、设计和部署完整的机架级架构、致力于面临芯片供应风险的数据中心设计,以及支持异构基础设施,这些都带来了独特的困难。

NVIDIA NVLink Fusion 提供了这一路径。NVLink Fusion 是一种高带宽、低延迟的互连技术和 IP,可将定制芯片连接到 NVIDIA 全球领先的 AI 基础设施平台。借助 NVLink Fusion,他们可以利用经过验证的 NVLink 纵向扩展堆栈和生态系统,降低半定制 AI 工厂的开发和部署复杂性、提高性能并缩短其上市时间。通过在单个统一架构上实现标准化,NVLink Fusion 简化了整个数据中心的操作,实现了对数据中心容量的灵活重新调配,并允许自定义 AI XPU 与 GPU 无缝集成以进行分解计算。

这打破了基本的限制,无需在自定义 XPU 和世界级 AI 平台之间进行选择。而且,由于 NVLink Fusion 与 NVIDIA 技术路线图保持同步,采用者可以跟上公司的年度节奏。

生产级 AI 工厂的发展路径

最快的独立加速器无法赢得下一个 AI 工厂。基础设施能够以最低的单位 token 成本、最快的周期和最低的部署风险提供最高的智能,从而赢得胜利。

NVLink 提供领先的性能,具有 3 倍的低延迟和 10 倍的高数据包速率,以及 130 TFLOPS 的网络计算、工厂弹性功能和成熟、成熟的平台。AI 工厂正在成为 AI 计算时代的标志性基础设施。NVLink 提供了强大的性能、可操作性、成熟度和持续创新。

详细了解 NVIDIA Vera Rubin 平台NVLinkNVLink Fusion

标签