最初是离散 AI 模型训练和面向人类的聊天界面,后来演变为始终在线的 AI 工厂,致力于大规模生产智能。现在,这些工厂的任务是为智能体工作流提供支持,以便在广泛的环境中进行推理、规划、使用工具、验证中间结果并执行复杂的多步骤任务。
代理式工作负载并非由单个提示和响应定义,而是由跨多个推理步骤的持续推理来定义。它们需要低的每步延迟、高解码吞吐量、高效的长上下文注意力、大的 KV 缓存容量,以及跨紧密合的 GPU 域扩展模型的能力。必须将数据中心重塑为单个计算单元,这一愿景借助 NVIDIA Vera Rubin 平台得以实现。
该平台的核心是 NVIDIA Rubin GPU,与 NVIDIA Blackwell 相比,其设计可将每单位能源的代理吞吐量提高 10 倍 (图 1) 。具有更高精度灵活性的增强型 Tensor Core、新的 HBM4 内存子系统和第三代 Transformer 引擎 (可提供高达 50 Petaflops 的 NVFP4 性能) 协同工作,可高效加速代理式工作负载。

本文将探讨 NVIDIA Rubin GPU 及其共同设计的纵向扩展系统如何解决代理式推理的端到端瓶颈,从数据移动和计算效率到长上下文执行和机架级部署。
Rubin GPU 架构如何支持代理式工作负载?
Rubin GPU (图 2) 由标线受限的计算裸片构建而成,可实现高密度和高效率。这两个裸片通过名为 NVIDIA 高带宽接口 (NV-HBI) 的高速裸片间链路整合在一个封装上。

当代理式工作负载在推理、生成、检索和工具使用之间切换时,该架构首先面临着保持大量计算生产力的挑战。其 3360 亿个晶体管、224 个流多元处理器 (SM) 和 896 个 Tensor Core 可提供原始计算密度,而第三代 Transformer 引擎可适应各种数字格式的精度。这种灵活性使 Rubin GPU 能够在保持准确性的同时提供高达 50 petaflops 的 NVFP4 推理性能。
但性能不仅仅取决于 Tensor Core 的吞吐量。Rubin GPU 利用大型集中式二级缓存将计算资源整理成图形处理器集群 (GPC) 。GigaThread 引擎可协调作业,MIG Control 可为多个工作负载划分 GPU 分区,而 NV-DEC 可加速解码。这些功能共同帮助 Rubin GPU 在定义大规模代理式系统的各种动态工作负载中,将计算密度转化为可持续的利用率。
这种利用率还取决于数据到达计算核心的速度。Rubin 集成了高达 288 GB 的 HBM4 显存,由专用的 HBM 控制器和 12-Hi 堆栈驱动,可提供高达 22 TB/s 的峰值带宽。增强型 Tensor Memory Accelerator (TMA) 可管理复杂数据布局中的高效移动,而 NVIDIA NVLink 6 可为 NVLink Switch 提供 3600 GB/s 的纵向扩展带宽,以实现多对多 GPU GPU 通信,NVLink-C2C 可提供 1800 GB/s 的一致性 CPU-GPU 通信,x16 PCIe Gen 6 可提供高达 256 GB/s 的主机连接。
最后,大规模智能体部署必须保护数据在此执行域中的移动。采用 TEE-I/ O 的机密计算旨在保护静态数据、传输数据和 AI 工厂中使用的数据。这些计算、内存、连接和安全功能共同构成了代理式工作负载的 GPU 级基础,这些工作负载必须在日益庞大的模型和扩展领域中保持高效执行。
Rubin GPU 如何加速关键推理路径?
仅凭峰值计算不足以加速代理式推理。现实世界的性能还取决于 GPU 移动数据、执行矩阵运算、处理长上下文注意力以及在相关内核之间转换的效率。本节将探讨旨在减少这些关键执行路径开销的 Rubin GPU 功能。
加速机架级 MoE 权重和 token 移动
多专家模型 (MoE) 可在多个专家网络中动态路由 token。随着专家数量的增加,高效定位和移动专家权重对于推理性能变得越来越重要。
Rubin GPU 增强了 Tensor 内存加速器,可减少数据移动用度,适用于专业级模型。它改进了描述符处理能力,使软件能够更高效地处理共享常见布局但驻留在内存不同位置的张量。
Rubin 通过对 TMA 的内联描述符更新支持来改进这一点 (图 3) 。内核无需修改内存中的描述符,而是可以在运行时直接在 TMA 指令中为共享相同布局和覆盖字段 (例如内存指针和步长) 的张量保留一个统一的描述符。

这有助于 MoE 模型随着专家数量的增加而更高效地扩展。通过减少元数据管理和数据移动开销,Rubin 可将更多 GPU 时间用于有用的推理计算,从而为依赖大型 MoE 模型的代理式工作负载提供更高的吞吐量。
将机架级矩阵运算的效率提高一倍
Rubin 沿 \(K\) 维度可处理的数据量翻倍,从而将每个时钟的 Tensor Core 吞吐量翻倍。这种优化不仅有助于限制吞吐量的内核,还有助于限制内存和延迟的内核。
由于模型执行被分割到许多 GPU 上,因此每个 GPU 通常会收到较小的输出工作片段,而归约维度仍然很大。
\(K\) 维度越大,\(K\) 循环迭代次数就越少。在图 4 中,需要在 Blackwell 上进行四次 \(K\) 迭代的 GEMM 可以在 Rubin 上完成两次迭代。减少迭代可减少循环开销,提高 Tensor Core 利用率,并有助于上下文和解码 GEMM 在高张量并行规模下更高效地运行。

对于受益于更紧凑的权重表示的模型,Rubin Transformer 引擎还支持矩阵 B 的 3 位查找表格式。该格式不是直接存储每个权重,而是将一个 3 位索引存储到一个包含代表性值的小表格中,而 Rubin Tensor Core 会内联解析这些索引,以减少权重存储和数据移动。基于 LUT 的表示可以保持高达 MXFP8 的准确性,为 Rubin 推理工具箱添加了另一个精度选项。
解决代理式 AI 长上下文处理中的主要挑战
长上下文和代理式 AI 工作负载给注意力带来了越来越大的压力。随着上下文窗口的增长,模型必须比较更多标记,对更大的注意力得分矩阵进行归一化,并将这些分数应用于用于生成下一层输出的值数据。这使得注意力成为提高每位用户每秒 token 数的重要性能路径之一。
Rubin 将激活稀疏性与自适应压缩相结合,并提高了 softmax 吞吐量,从而加速注意力。以下是使用 Rubin 新稀疏功能的一种简单、安全且有效的方法。注意力工作流从密集 \(QK^T\) 计算开始,以生成中间注意力分数。然后,Rubin 可以将 Tensor 内存中的中间数据加载到结构化的 2:4 稀疏压缩形式中,生成非零值和高效使用这些值所需的元数据,同时降低分数的写入成本和存储需求。这使得后期注意力阶段能够使用更少的数据,同时保留模型其余部分所期望的密集输出格式。

这种压缩的中间表示在两个关键位置减少了工作:softmax 和第二个注意力 GEMM。Softmax 可以对非零注意力值进行运算,以下与密集 \(V\) 矩阵的乘法运算可以使用稀疏 MMA、Softmax 中的非零以及原始压缩步骤中的元数据。其结果是,在长上下文注意力最昂贵的部分中,计算和数据移动减少了 token/ 瓦,而无需周围的模型工作流更改其接口。
Rubin 还提高了 softmax 吞吐量。随着 Tensor Core 吞吐量的增加,softmax 可能会成为瓶颈,因为它依赖于指数级数学运算和注意力行之间的归约。Rubin 的吞吐量呈指数级增长,包括相较于 Blackwell 基准的 2 倍 FP32 和 4 倍 BF16/ FP16 吞吐量,帮助 softmax 与更快的矩阵运算保持同步。
| NVIDIA GPU 平台 | FP32 指数级吞吐量 (每个 SM 的每 clk) |
BF16/ FP16 指数级吞吐量 (每个 SM 的每 clk) |
| Blackwell | 1x | 1x |
| Blackwell Ultra | 2x | 2x |
| Rubin | 2x | 4 倍 |
这些功能共同使 Rubin 注意力加速不仅仅是单核改进。激活稀疏会减少中间注意力工作量,而更快的指数会减少 softmax 瓶颈。
提高内核执行效率
随着推理扩展到更大的模型和更多 GPU,原始 Tensor Core 吞吐量只是性能的一部分。GPU 还需要高效地从一个内核迁移到下一个内核。在推理中,这一点尤为重要,因为激活函数通常位于关键路径上:一个内核生成激活数据并将其写入内存,而下一个内核使用该数据继续生成下一个令牌。
传统的制作人 – 消费者执行可能会在 GPU 时间轴中产生气泡。制作者内核可能会提前完成某些图块或线程块的工作,但在解决更广泛的依赖关系之前,消费者可能不会开始有用的工作。Blackwell 程序依赖启动通过允许更早的消费级内核进程来改善这一点,但依赖性工作仍然可以等待所需的激活数据变得可用。

Rubin 可在相关内核之间实现更精细的协调。这样一来,用户可以在必要的输入数据可用时更早地开始工作,而无需等待更多的制作者工作完成。
其结果是 GPU 时间轴的填充更加紧密,空闲空隙减少,相关内核之间的重叠得到改善。这对于代理式推理尤为重要,因为激活函数会依次在模型中移动,而内核到内核的延迟会直接影响每位用户的每秒 token 数。
Rubin 内存和通信如何维持高吞吐量推理?
随着模型、上下文窗口和 GPU 域的增长,数据移动变得与计算同样重要。Rubin 旨在改善 GPU 内和跨纵向扩展系统的权重流、激活函数、KV 缓存数据和通信流量。以下各节将探讨有助于维持高吞吐量推理的内存和通信创新。
加速纵向扩展通信
随着推理从单个 GPU 扩展到完整的机架级系统,通信成为关键性能路径的一部分。当通信直接在 GPU 内核中融合时,内核不会停止并将控制权交回 CPU;当计算仍在进行时,内核会直接通过 NVLink 将数据写入另一个 GPU 或执行归约。
传统的 GPU 到 GPU 通信除了移动有效载荷数据外,还需要协调和同步工作。这些步骤可能会增加延迟并消耗互连带宽,尤其是在分布式推理工作负载中频繁进行通信时。
Rubin 为设备启动的 NVLink 通信引入了计数写入。此功能允许接收方 GPU 更高效地跟踪传输完成情况,从而简化了 GPU 到 GPU 数据传输的同步。

具有计数写入的 NVLink 融合通信为协调 GPU 到 GPU 的数据移动提供了一种低延迟机制,有助于保持计算移动,而不是等待同步操作。
共同设计内存子系统,实现更高的功耗和计算效率
推理的解码或生成阶段从根本上说是受内存子系统限制的。它不涉及峰值带宽规格,而是每个内核利用整个内存子系统的效率。现代推理和代理式工作负载通过在解码中花费更多的端到端运行时间来放大这一限制:长上下文、大型 KV 缓存和交互式令牌生成使实现的内存带宽成为关键的性能杠杆。

Rubin 通过将 HBM4 与高效的局部内存子系统相结合来解决这一问题。HBM4 的接口宽度是 HBM3e 的两倍。结合新的内存控制器、与内存生态系统的深度联合设计以及更紧密的计算内存集成,该子系统可提供高达 22 TB/s 的内存带宽,比 Blackwell 和 Blackwell Ultra 高 2.8 倍。
Rubin 还为每个 GPU 提供高达 288 GB 的 HBM4,与 Blackwell 相比,增加了可用的封装容量。容量和带宽发挥着不同但互补的作用:
- 容量:支持模型驻留、更大的上下文窗口、更大的 KV 缓存和更高的并发性,而无需不必要的 KV 缓存卸载。
- 带宽:支持逐标记生成阶段,在此期间,模型权重和 KV 状态必须足够快地移动,以保持计算引擎的工作效率。
- 内存子系统:TMA 和内存定位策略可帮助软件高效使用内存子系统,为复杂数据布局提供高带宽支持。
高容量、高带宽 HBM4 对于托管数万亿参数模型、在不卸载 KV 缓存的情况下扩展上下文长度以及支持高并发、长 Horizon 推理工作负载至关重要。
NVIDIA 如何设计提高效率、可扩展性和可靠性?
代理式 AI 基础设施不仅要优化单个 GPU,还必须在整个 AI 工厂中有效利用电力、冷却、网络和机架级资源。NVIDIA Vera Rubin NVL72 将 GPU 架构扩展为集成式、弹性机架级执行域。本节将探讨 NVIDIA 如何提高能效、操作可扩展性和系统级可靠性。
在相同功率预算下增加 GPU 数量
代理式 AI 使能效成为 AI 工厂问题,而不仅仅是 GPU 功耗问题。在机架规模上,Vera Rubin NVL72 将计算、网络、液冷、动力转向和智能 Power Smoothing 与能源存储集成到单个执行域中,旨在在固定功率范围内更大限度地提高有用的 token 输出。

在 AI 工作负载期间,电力需求可能会发生巨大变化,从而产生瞬变峰值,限制可用容量并降低工厂级吞吐量。Vera Rubin 电源使用充电状态 (SoC) 智能功耗平滑技术来吸收这些波动,与上一代功耗平滑技术相比,可将平均功耗降低约 10%,并将 50 毫秒峰值功耗降低约 20%。通过提供更稳定的功率曲线,该系统可以降低持续的最大功率需求,为电力基础设施和电网提供支持,并在相同的 AI 工厂电力预算内实现更多计算。
在 AI 工厂层面,NVIDIA DSX MaxLPS 将这种方法扩展到 GPU、机架、45 ° C 液冷和工作负载,而 DSX OS 则为调度、生命周期管理和医疗自动化提供操作层。它们共同设计,可在固定的兆瓦级功率范围内恢复闲置电力并增加有用的计算能力。借助 DSX MaxLPS,运营商可以在相同的功耗预算范围内,以高能效操作点调配多达 40% 的 GPU (图 10) ,同时将对工作负载性能的影响降至最低。

设计具有弹性和数据中心可扩展性的机架
Vera Rubin NVL72 将 Rubin GPU 扩展为机架级执行域,可用于数万亿参数和多机架代理式工作负载。其第三代 MGX 机架架构将无线缆计算和交换托盘、45 ° C 液冷、动态机架级动力转向和智能 Power Smoothing 相结合,将计算、网络、冷却和电源作为一个系统保持运行。热插拔 NVLink 交换机托盘和改进的 RAS 功能进一步支持大规模弹性运行。
这种机架设计是 Pod 级多机架代理式系统的基础,可跨 NVLink 和 NVIDIA Spectrum-X 以太网实现开放、灵活的连接。
了解详情
NVIDIA Rubin GPU 专为代理式 AI 的执行模式而设计,在这些模式中,长上下文推理、多步骤生成、分布式 MoE 解码和低延迟交互必须持续大规模运行。其计算、内存、网络、机架级扩展、电源、冷却和软件层经过精心设计,可让更多 AI 工厂执行有用的工作,而无需因数据、通信或电源限制而等待。其构建的架构能够更大限度地提高每瓦的代理性能,从而在固定功率范围内生成更多有用的 token 并完成 AI 工作。
如需深入了解机架架构和更广泛的 NVIDIA Vera Rubin 平台,请参阅深入了解 NVIDIA Vera Rubin 平台:六款新芯片,一台 AI 超级计算机。如需详细了解 NVIDIA Vera Rubin POD,请参阅 NVIDIA Vera Rubin POD:七个芯片、五个机架级系统、一台 AI 超级计算机。
致谢
这项工作得益于 Jeff Pool、Ran Zilberstein、Ronny Krashinksky、Sailaja Madduri、Shivam Raj、Xiaowei Wang、Manas Mandal、Bita Darvish、Raj Dash 以及许多其他才华横溢的 NVIDIA 工程师的专业知识和工程贡献。