网络/通讯

十亿级 AI 和以太网演进:Spectrum-X 以太网如何重写规则

生成式 AI 的迅猛发展从根本上改变了数据中心的设计。随着分布式模型训练规模扩展到数十万个 GPU,连接这些节点的横向扩展网络已成为一阶性能瓶颈。

几十年来,传统的现成以太网一直是企业和云网络无可争议的王者。它在处理通用、高网络流量方面成本低廉、标准化且非常有效。然而,当传统以太网不得不处理 AI 架构所需的大规模、高度同步的通信模式时,它就会遇到物理墙。

为了弥合这一差距,NVIDIA 推出了 Spectrum-X 以太网,这是一种硬件加速的网络架构,专为十亿级 AI 工厂而设计。传统以太网依赖数十年的路由和拥塞控制范式,而 Spectrum-X 以太网则与之不同,它共同设计了高性能交换机和主机侧网卡 (NIC) ,可在极端负载和压力下提供可预测的低延迟、高网络利用率和强大的弹性。

本文将探讨导致传统以太网不适合 AI 工作负载的结构限制,解构 Spectrum-X 以太网的独特架构原则,并解释 Spectrum-X 多平面技术如何最大限度地提高对分带宽并加速 AI 时间。

碰撞课程:传统以太网无法处理 AI 工作负载的原因

标准数据中心流量的值很高;数百万独立的小型流量会向不同的方向传输。等价多路径 (ECMP) 路由使用静态流哈希将其分布在并行路径上,通常会实现利用率的平衡。

AI 训练流量具有低。GPU 通过 All-Reduce、All-Gather 和 All-to-All 等群集持续同步,从而创建相对较少的大型同步流。这暴露了传统以太网的三个限制:

  • 哈希冲突和散列冲突:ECMP 没有考虑实时拥塞,因此大型流可能会在一个链路上发生碰撞,而其他链路则未得到充分利用。由于同步群集仅在其最慢的流完成时才结束,因此一条拥塞的路径可能会延迟群集,并使许多 GPU 处于空闲状态。
  • 有损与无损操作:拥塞会使交换机缓冲区溢出,并引发数据包丢失和重传,从而导致延迟,从而显著损害 AI 性能。RoCEv2 部署通常使用优先流控制 (PFC) 来减少损失,但暂停帧会扩大拥塞,造成头部阻塞,并可能导致网络中断。
  • 缓慢的拥塞控制:数据中心量化拥塞通知 (DCQCN) 等协议可能难以针对同步 AI 突发进行调整。延迟或过度反应会导致缓冲区积聚、利用率不足和延迟峰值。
  • 近乎完美的多租户隔离:借助传统以太网,来自一个作业的“相邻噪声”流量可能会流入另一个作业,导致 All-to-All 集合体的带宽崩溃 80% 以上。DeepSeek-V3 LLM 训练模拟中证明了这种隔离故障。独立运行时,标准以太网实现了 735 毫秒的训练步长时间。但是,在引入背景“噪声”流量时,标准以太网的步长时间增加到 1.18 秒 (速度减慢了 1.6 倍) 。Spectrum-X 以太网通过隔离每个平面的拥塞并围绕热点进行动态路由,在独立和高度拥塞的多租户条件下保持了 668 毫秒的稳定训练步长时间,几乎没有任何性能下降。

解构 Spectrum-X 以太网:三个互联的控制回路

在每秒 800 千兆比特 (Gbps) 及以上的速度下,传播延迟仍然由光速固定不变,但带宽延迟乘积是巨大的。为了避免队列积聚和数据包丢失,网络结构必须在微秒级时间尺度上对拥塞做出实时反应。

由于基于软件的控制路径无法在这些紧凑的窗口内做出反应,Spectrum-X 以太网将实现完整的硬件加速作为核心结构要求。Spectrum-X 以太网的基本设计原则是按范围、信号和责任划分硬件加速的控制回路。通过将网络控制分解为三个不同的非干扰回路,Spectrum-X 以太网可在自然时间范围内解决拥塞问题,而不会产生破坏网络稳定的反馈回路。

交换机内自适应路由

与传统以太网基于哈希的静态 ECMP 路由不同,Spectrum-X 以太网交换机可实现每数据包自适应路由 (AR) 。交换机利用 Join-Shortest-Queue (JSQ) 算法的量化硬件近似,以亚微秒的间隔对 ECMP 组中每个出口端口的队列深度进行采样。当数据包到达时,交换机会动态地将其引导到拥塞最少的物理端口。这种无状态、与流无关的机制会在数百纳秒内对瞬变局部失衡做出反应,从而保持交换机队列较小,并防止出现局部热点。

定向拥塞控制

虽然 AR 可均衡网络中的路径利用率,但无法解决端点 incast 问题,在这种情况下,多个发送者同时向单个接收者传输数据,使接收者的出口端口饱和。为此,Spectrum-X 以太网实现了先进的硬件加速拥塞控制 (CC) 机制。

重要的是,Spectrum-X 以太网会共同设计交换机和 SuperNIC 响应:只有当自适应路由容量完全耗尽且队列不断增长时,交换机才会生成显式拥塞通知 (ECN) 标记。发送者利用精确的 RTT 探针与 ECN 标志,在 RTT 时间尺度上调整其发送速率。这可防止网络对短暂的微爆发 ( AR 很容易平衡) 反应过度,同时在真正发生端点级拥塞时提供快速、精确的速率降低。

基于网卡的平面负载均衡

平面负载均衡器 (PLB) 在主机边缘运行,是 Spectrum-X 以太网 SuperNIC (例如 NVIDIA ConnectX) 内部的专用硬件引擎。PLB 结合使用本地队列反馈和端到端、每平面拥塞遥测技术,在多个网络平面上动态分配数据包。这种机制将在下文中进行深入讨论。

揭秘多平面拓扑和 Spectrum-X 多平面技术

为了将 AI 工厂扩展到数十万个 GPU,传统的网络架构需要添加额外的层 (例如,从 2 层到 3 层胖树拓扑) 。但是,添加层级存在很大问题:这会增加延迟、增加抖动、引入负载不平衡,并大幅提高光学、布线和电源的成本。

为了解决扩展挑战,现代 AI 数据中心利用了多平面拓扑。多平面拓扑不是构建单个大型多层网络结构,而是将单个主机的海量网络带宽 (例如,8 通道 ConnectX SuperNIC 的 800 Gbps) 分解为多个低速度、物理上独立的网络平面 (例如,四个独立的 200 Gbps 平面) 。每个平面都是高效的浅层两层胖树。

为了将主机连接到这些平面,在主机边缘使用了无源光学设备,例如 shuffle-box 或主干线缆。这些设备将光纤从每个多端口网卡路由到所有独立的平面,在主机边缘显示大量路径多样性,同时保持完整的网卡到网卡可访问性。这使得简单的两层拓扑能够扩展到超过 128000 个端点,或使用三层拓扑多达 1600 万个端点,而不会引入传统多层网络拓扑的延迟和抖动瓶颈。

遗忘数据包喷洒的缺陷

虽然多平面拓扑提供了大量的理论带宽,但只有在所有平面的流量完全平衡的情况下,它才有效。一些标准架构试图通过随意喷洒来解决这一问题,即数据包按顺序分布在传输层的所有平面上,而对单个平面的状况没有任何可见性。

这种方法在现实世界中完全不存在。就十亿级规模而言,物理故障、光连接器性能下降和光纤链路翼是稳定运行的现实。如果平面 2 中的单个光纤链路发生性能下降或翼断裂,该平面的容量就会下降。由于随意喷洒会忽视这种不对称性,因此会继续将同等数量的流量转移到性能下降的平面上。因此,整个网络的性能受到最慢、性能下降的平面的瓶颈,并且单个局部链路皮瓣的爆炸半径被放大,以涵盖整个多平面集群。

解决方案:Spectrum-X 多平面技术

为了释放多平面架构的真正潜力,Spectrum-X Multiplane 技术直接在 SuperNIC 芯片中实现了硬件加速的平面负载均衡器 (PLB) 。平面负载均衡器使多平面架构对应用层完全透明;操作系统和集合通信库只能看到单个统一的 RoCE 设备。所有流量分配、负载均衡和故障转移均完全在 Spectrum-X 以太网硬件中处理。

与 Spectrum-X 以太网交换机配合使用时,PLB 会针对每个传输的数据包,通过独特的、有状态的两阶段分层选择流程进行操作:

  • 端到端拥塞过滤:对于每个目标 GPU,SuperNIC 都会维护独立、有状态的拥塞控制上下文;每个物理平面一个上下文。每个上下文都独立监控 RTT 探针并处理拥塞通知数据包 (CNP) ,以计算其特定平面的实时速率允许量。在发送数据包之前,SuperNIC 会将所需的传输速率与每个平面的带宽进行比较。任何遇到端到端拥塞或链路故障的平面都会暂时从符合条件的集合中过滤掉。
  • 本地队列选择:SuperNIC 硬件从剩余、正常、不拥塞的平面中选择本地出口队列最浅的平面。这反映了交换机在主机边缘的自适应路由机制。

通过分离每个平面的 CC 状态并将其与本地出口队列深度相结合,Spectrum-X 以太网可隔离受影响平面的拥塞。如果平面 2 发生链路故障,Connect-X SuperNIC 会立即检测到 RTT 超时,遮罩符合资格的平面集的平面 2,并在 3 毫秒内透明地重定向其余三个正常平面上的所有流量,从而保留 75% 的总线速率对分带宽。

现实世界的影响:弹性、隔离和 AI 时间

为了验证这些架构设计,NVIDIA 和研究人员在生产级集群和高保真仿真中严格评估了 Spectrum-X 以太网。结果表明,在高利用率、故障场景和多租户环境下,Spectrum-X 以太网与传统的现有以太网形成了鲜明的对比:

  • 多平面弹性:例如,当仅在 8 平面网络的一个平面上发生 20% 的局部交换机到交换机连接故障时,传统的以太网多平面网络会立即成为瓶颈。由于其依赖的是不需要注意的负载均衡,因此其在每个平面上的性能都会崩溃,以匹配降级的平面,将整个网络的容量限制在 80%。相比之下,Spectrum-X Multiplane 使用其有状态 PLB 动态地绕过局部瓶颈,使七个正常的平面以 100% 的容量运行,而只有降级的平面以 80% 的容量运行。Spectrum-X Multiplane 利用所有可用的正常容量,而不是降低到最低的共同标准,可在发生故障时将整体 All-to-All 集合带宽提高 1.2 倍,从而提供保持大规模 AI 训练工作所需的流畅、按容量比例的性能下降。

  • 可预测的高利用率性能:在最坏情况下的 RDMA 对分基准测试中,传统以太网的静态 ECMP 路由因流哈希冲突而崩溃,一些 GPU 对的吞吐量下降到 25 Gbps。Spectrum-X 以太网利用 AR 和 PLB 提供紧密且可预测的带宽分配,在所有 GPU 对中维持 98% 的理论线速。此外,传统以太网呈现宽延迟抖动,第 99 百分位 (P99) 尾部延迟高达 22 µs,而 Spectrum-X 以太网可在 75% 的网络负载下保持 8 到 9 µs 的低紧密集群式 P99 尾部延迟。

  • 无缝的故障转移弹性:当主机到叶连接翼上的链路发生故障时,传统以太网基于软件或非加速的负载均衡器需要超过 1.08 秒的时间来恢复和重新路由流量。这会导致大量通信停顿,从而冻结 GPU 集合运算。相比之下,Spectrum-X 以太网的硬件加速 PLB 可检测故障并在 2.68 毫秒内完成故障转移。这是 400 倍的加速,可以透明地吸收瞬时故障,而不会中断正在进行的 LLM 训练步骤。

最后要考虑的是,链路故障是不可避免的,但其对性能的影响应与物理连接的损失成正比。实现这一目标十分困难,因为路径中的多个故障会严重降低许多源 – 目标对的连接性。

传统以太网会在线缆故障和链路翼时以非比例的方式降低性能;由于路由不对称,10% 的叶上行链路掉线可能会导致总带宽崩溃 50% 或更多。Spectrum-X 以太网会严格按比例降低容量。在 10% 的网络链路故障情况下,Spectrum-X 以太网可保持近乎理想的性能,带宽按比例降低 11%,尾端延迟仅增加 7%。

这种强大的弹性可确保操作员即使在所有物理基础设施问题得到完全解决之前,也能以近乎最佳的效率运行训练工作负载,从而大幅缩短“AI 时间”

当今 AI 工厂的蓝图

从通用云计算到十亿级生成式 AI 的转变代表着网络需求的根本性转变。传统的现成以太网基于高流量、静态路由和软件控制的拥塞循环的假设而构建,从根本上无法满足同步 AI 群集的微秒级零抖动需求。

Spectrum-X 以太网重写了网络规则手册。Spectrum-X 以太网通过网络内的动态路由、传输层的定向拥塞控制和主机边缘的 PLB 对关键控制回路进行解和硬件加速,可提供可预测、稳定和超低延迟的性能,满足十亿级 AI 的需求。此外,Spectrum-X Multiplane 技术提供了一个稳健、高弹性和操作可见的网络结构,可简化集群扩展,保护多租户工作负载,并更大限度地缩短“AI 时间”对于任何构建 AI 工厂的组织而言,Spectrum-X 以太网不仅仅是一种性能优化,更是一种架构需求。

深入了解

如需详细了解 Spectrum-X 以太网和 Spectrum-X Multiplane,请在此处阅读已发布的白皮书。

资源

标签