网络/通讯

NVIDIA BlueField-4 为代理式 AI 工厂提供新的 Scale-In 网络基础设施

AI 生成摘要

  • NVIDIA 推出了 Scale-In 网络基础设施,它是 NVIDIA AI 网络的第五大支柱,为代理式 AI 工厂的安全、管理和运营带来专门的加速。
  • NVIDIA BlueField-4 通过 64 核 Grace CPU、在线加速引擎和 800 Gb/s 网络接口提供独立于主机的基础设施处理能力,以线速处理安全、数据传输和操作。
  • NVIDIA DOCA 通过容器化微服务和 SDK 提供 Scale-In 服务,在 BlueField-4 系统中实现网络、安全、存储和遥测的统一操作。
  • NVIDIA Spectrum-X 以太网在 Scale-In 访问路径中提供高性能网络,支持拥塞管理和性能隔离功能,可实现一致的存储和访问吞吐量。
  • Scale-In 用例包括采用基于 DOCA 主机网络(HBN)的隔离 AI 工厂虚拟私有云(VPC)、通过 DOCA Argus 和 DOCA Vault 实现硬件增强的安全性、加速存储访问实现高达 1.45 倍性能、通过 DOCA 平台框架实现 DPU 原生控制平面编排,以及通过 DOCA Telemetry 实现全局可观察性。

后续步骤

传统的云基础设施为可预测的通用工作负载和标准接口而设计。代理式 AI 工厂连接不同的用户、代理、应用、数据源和存储系统,以每台服务器数 Tb 带宽实现大规模加速计算,从而使专用 DPU 处理成为线速网络、存储和安全的关键。NVIDIA 推出 Scale-In 网络基础设施,这是 NVIDIA AI 网络的第五大支柱,可为代理式 AI 工厂的安全、管理和运营带来专门的加速。

Scale-In 将南北向网络发展成为 AI 工厂的协调基础设施域。由 NVIDIA BlueField-4 以及 NVIDIA DOCA 并通过 NVIDIA Spectrum-X 以太网进行连接,Scale-In 可加速保护整个 AI 堆栈的服务,为 AI 工厂中移动应用、数据和存储流量保驾护航。专用加速处理将这些基础设施服务独立于主机 CPU 之外,防止安全、数据访问和操作成为 AI 计算扩展时的瓶颈。其结果是更安全、更高效的共享 AI 基础设施,随着需求的增长,能够持续访问 AI 服务和数据。

本文将探讨 BlueField-4 架构,并解析 Scale-In 如何为代理式 AI 工厂提供安全访问、高性能数据移动、租户隔离、简化操作和更可预测的性能。

Scale-In 加速南北向 AI 工厂基础设施

AI 工厂在不同的规模上有不同的基础设施要求:

  • Scale-Up (纵向扩展):NVIDIA NVLink 将 GPU 整合为一个加速器整体。
  • Scale-Out (横向扩展):NVIDIA Spectrum-X 以太网和 NVIDIA Quantum InfiniBand 连接 AI 工厂中的服务器。
  • Scale-Across (跨域扩展):NVIDIA Spectrum-XGS 以太网连接分布式 AI 工厂。
  • 上下文记忆存储:NVIDIA CMX,基于 NVIDIA STX 为 AI 原生存储提供模块化基础,在 AI 工厂内提供共享的 KV 缓存存储。
  • Scale-In (全局互连网络):NVIDIA BlueField-4、NVIDIA DOCA 和 NVIDIA Spectrum-X 以太网加速与 AI 计算相关的访问、安全、数据传输和基础设施运营。

南北向网络提供进出数据中心的访问路径,将用户、应用、数据源、存储系统和服务连接到各个系统。传统的云数据中心围绕软件定义的基础设施、可组合性和弹性构建这些网络,因此可以根据需求变化调配和扩展资源和访问权限。

代理式 AI 提高了对这种基础设施的需求。软件定义网络、可组合性和弹性仍然至关重要,但它们已无法满足需求。AI 工厂将大规模加速计算与越来越多的用户、智能体、应用、企业数据源和存储系统结合在一起,并且这些组件都在持续进行大规模交互。

基础设施必须作为 AI 工厂的一部分进行加速和协同设计。安全性、多租户网络、数据和存储访问以及基础设施运营不能仅仅依靠在通用主机 CPU 上运行的软件,或额外运行的管理层。这些功能必须作为一个统一的基础设施域协同工作,使运营人员能够对整个 AI 工厂的访问、数据移动、安全性、调配和可观察性进行一致的控制。

Scale-In 通过将南北向访问发展为整个 AI 工厂的统一、加速的基础设施域来满足这些需求。BlueField-4 提供独立于主机的加速和卸载,DOCA 提供用于编程和运营基础设施服务的统一模型,Spectrum-X 以太网在 Scale-In 访问路径中提供高性能以太网连接,包括外部存储和数据源。它们共同助力运营团队在支持加速计算和数据存储的基础设施中对访问、数据移动、安全性、调配和可观察性进行一致控制。

AI 工厂依靠互补的存储基础设施来处理持久性数据和推理上下文。Scale-In 提供对 AI 原生存储的高性能访问,包括用于训练、推理和分析的 AI 工厂存储,以及用于检索和多模态索引的企业 AI 数据系统。另外,CMX 为 AI 工厂内的共享 KV 缓存和可重复使用的推理状态提供 Pod 级存储。BlueField-4 既可用作 Scale-In 的基础设施处理器,也可单独用作 CMX 的数据和存储处理器。Scale-In 将 AI 工厂和企业数据连接到 AI 计算,而 CMX 则保留和共享上下文,从而实现更快、更高效的推理。

这五大基础设施支柱共同为整个 AI 工厂的不同需求提供支持。只有在数据访问、存储、网络安全和运营相应随之扩展时,扩展 GPU、机架和数据中心才能带来应有的价值。

BlueField-4 为 Scale-In 基础设施提供支持

BlueField-4 可加速跨 GPU 服务器、代理式 CPU 系统、AI 工厂存储系统和云服务的 Scale-In 服务。在 NVIDIA Vera Rubin NVL72 系统中,NVIDIA ConnectX-9 SuperNIC 通过 Scale-Out 网络传输租户工作负载流量,而 BlueField-4 则运行和加速基础设施服务,以连接、保护和管理每台服务器。BlueField-4 为企业运营提供了租户主机之外的独立基础设施处理域,他们可以在其中管理安全策略、服务状态和遥测,而无需依赖主机 CPU 或消耗其资源。

NVIDIA BlueField Astra 将可信控制从南北向访问扩展到东西向横向扩展网络。Astra 为服务提供商提供了一个独立于主机的统一控制点,用于跨两个域的调配、租户隔离和网络策略。BlueField-4 安装和更新策略并监控遥测,而 ConnectX-9 直接在数据路径中执行这些策略。此闭环在 Scale-In 和 Scale-Out 之间提供一致的控制,而无需在租户主机中运行设备管理。

BlueField-4 将可编程控制平面处理与加速数据路径处理相结合。软件做出基础设施决策,而内联引擎则在本地执行这些决策,而无需将工作返回主机 CPU。这种设计使整个工厂能够协调策略,并以线速在本地执行。表 1 总结了主要组件如何支持此处理模型。

组件 角色 优势
64 核 NVIDIA Grace CPU 运行策略、调配、遥测和基础架构编排软件 与上一代产品相比计算能力提高 6 倍,轻松同时运行多个基础设施服务
内联加速引擎 处理数据包、RDMA、存储协议、加密、防火墙规则和策略执行 以 800 Gb/s 线速处理操作,同时减轻 Grace CPU 和主机 CPU 的处理负担
LPDDR5X 内存子系统 为基础设施软件提供数据和服务状态 提供高内存带宽和节能高效的操作,消除访存瓶颈
PCIe Gen6 主机连接 将 BlueField-4 连接到主机服务器 在主机和 Scale-In 基础设施处理域之间提供高带宽路径
800 Gb/s 网络接口 将服务器连接到 Scale-In 网络 支持高吞吐访问、安全、数据移动和存储流量

表 1. BlueField-4 组件在 Scale-In 处理路径中平衡控制平面处理、数据路径加速、内存访问、主机 I/ O 和网络带宽。

与 BlueField-3 相比,BlueField-4 提供 4 倍的内存带宽和 2 倍的网络带宽。这种能力增强可支持更多并发服务、更大的策略和遥测数据集,以及更高的流量处理和安全吞吐量。

NVIDIA DOCA 编程实现 Scale-In 服务

NVIDIA DOCA 将 BlueField-4 的硬件加速器转变为可编程和可部署的 Scale-In 服务。可用于生产的容器化 DOCA 微服务可以直接在 BlueField-4 上运行,而 DOCA 库和 SDK 支持开发者访问用于自定义服务的加速网络、安全、存储和遥测功能。DOCA Flow 为硬件数据包处理工作流编程,DOCA PCC 支持可编程拥塞行为,DOCA Telemetry 提供设备和服务运行状况,DOCA Platform Framework (DPF) 管理调配、部署和更新。BlueField-4 的多服务架构和原生服务功能链通过所需的服务序列引导每个流量流。这些功能为跨 BlueField-4 系统操作服务提供了统一的软件模型,而无需管理单独的服务器工作流。

NVIDIA Spectrum-X 以太网连接 Scale-In 网络

NVIDIA Spectrum-X 以太网为 Scale-In 访问路径提供高性能网络,包括外部存储。BlueField-4 处理每个系统的基础设施服务,而 Spectrum-X 以太网在 AI 工厂与相关的用户、应用、数据源、服务和外部存储之间传输流量。Spectrum-X 以太网可在大规模网络解决负载平衡冲突和拥塞问题,提高资源利用率,帮助保持高效带宽,并隔离并发流量,从而使访问和存储流获得更一致、更可预测的性能。

BlueField-4 DPU、DOCA 微服务和 Spectrum-X 以太网与 NVIDIA Vera Rubin 协同设计,因此处理器性能、内存带宽、PCIe 连接、网络带宽、加速和软件都可以与时俱进。它们共同服务于 Scale-In 路径,处理传输、服务处理和控制,避免消耗分配给 AI 工作负载的资源。

代理式 AI 工厂的典型 Scale-In 用例

代理式 AI 工厂必须安全地共享加速基础设施,为其提供企业数据、支持系统上线,并持续监控性能。以下用例展示了 BlueField-4 加速和 DOCA 服务如何满足这些生产需求。

构建隔离的 AI 工厂虚拟私有云

AI 工厂虚拟私有云 (VPC) 可在共享物理基础设施上隔离租户和应用程序流量。DOCA 基于主机的网络 (HBN) 可在 BlueField-4 上加速南北 3 层路由和多租户隔离。DOCA Flow 为流量分类和访问控制规则编程,而 DOCA 加速的 Open vSwitch (OVS-DOCA) 在东西向接口上应用了相应的策略。BlueField Astra 在东西向横向扩展 (Scale-Out) 接口之间扩展了相同的 VPC 策略,因此只需一个策略模型即可控制访问流量和横向扩展 (Scale-Out) 流量。

在 Vera Rubin 中,此协调模型的聚合接口带宽达到 7.2 Tb/s,其中南北 BlueField-4 路径的带宽为 800 Gb/s,每个计算托盘的东西向路径带宽为四个 1.6 Tb/s,为访问和 Scale Out 流量提供一致的策略覆盖,无需通过 800 Gb/s 接口路由所有东西向流量。运营侧集中调配隔离的 AI 工厂 VPC,而租户则继续使用加速网络。此架构提供类似云的弹性、一致的隔离、更低的主机 CPU 开销,更高效地使用共享 AI 基础设施。

在芯片中实现安全性

BlueField-4 将执行点置于主机操作系统之外的硬件中。租户软件无法禁用或绕过这些管控,而卸载安全处理可保留主机 CPU 资源,避免额外的软件跳转。BlueField-4 可加速安全检测,并以线速执行网络、文件和对象访问策略。DOCA Argus 提供运行时安全检测,DOCA Vault 执行文件访问策略,DOCA Flow 编程线速网络执行。BlueField Astra 可跨服务器上的不同网络协调加密、隔离和策略。Astra 可跨南北向和东西向流量同步策略、遥测、密钥和执行,在租户主机之外保持特权安全控制,为共享 AI 服务提供一致的保护,并为 AI 工作负载保留主机资源。

加速存储访问

Scale-In 将 AI 计算连接到训练数据、模型资产、企业知识和来自外部存储的应用数据。如果存储协议处理、存储虚拟化或数据移动无法跟上步伐,GPU 就会发生等待,即使仍然具备可用计算和 Scale-Up/ Scale-Out 网络带宽资源。

BlueField-4 可在专用基础设施上通过 RDMA 和 TCP 加速 NVMe-oF、文件和对象存储协议、存储虚拟化以及数据移动。Spectrum-X 以太网在整个存储路径中提供面向 AI 优化的以太网架构,其中拥塞管理和性能隔离有助于在并发存储流中保持高效带宽,与通用以太网相比存储吞吐量可提高 1.45 倍。这降低了主机 CPU 负担,有助于保持 AI 计算的供给,并提供对企业数据的一致访问,以进行训练、检索和推理。这些外部数据路径是对 CMX 的有效补充。

运行 AI 工厂控制平面

在运行 AI 工作负载之前,必须对 AI 工厂节点进行调配、配置、安全保护和连接。BlueField-4 板载节点,调配网络和存储资源,启动服务器,并通过网络加载主机操作系统。由于此控制平面独立于主机运行,因此它会在租户软件启动之前制定策略并调配资源。DOCA 平台框架是一个 Kubernetes 原生编排框架,可将 BlueField DPU 作为 Kubernetes 节点进行调配、管理和扩展。它管理整个 AI 工厂的 DPU 发现、调配、服务部署和更新。这样可以缩短部署时间、提高配置一致性、保留主机 CPU 资源,并更快地实现新的 AI 能力上线。

观察和优化 AI 运营

运营大规模 AI 工厂需要持续监控网络流量、存储访问、服务运行状况、性能和资源利用率。DOCA Telemetry 收集这些信息并将其导出到网络监控平台,而 DOCA 库支持将相同的基础设施信息集成到客户自己的观察监控工具中。通过 BlueField-4 收集遥测数据,运维人员可以独立于租户主机软件保持对系统的可见性。当基础设施遥测扩展到 GPU 和网络利用率时,运营人员可以识别与访问、流量、存储、策略执行或工作负载相关的限制条件。这种全视野可见性有助于检测异常、定位瓶颈,并在事件影响 AI 工作负载之前将其解决。

Scale-In 将扩展计算转化为 AI 工厂性能

Scale-In 将南北向网络发展为协调、加速的基础设施域,用于数据访问、安全和运营。NVIDIA BlueField-4 提供网络加速、DOCA 编程和运营服务,而 Spectrum-X 以太网则在 Scale-In 访问和存储路径中提供高效的带宽和性能隔离。它们共同帮助将扩展计算转变为安全、可运营的 AI 工厂平台。

后续步骤

标签