传统的云基础设施专为可预测的通用工作负载和标准接口而设计。代理式 AI 工厂可连接不同的用户、智能体、应用、数据源和存储系统,以每台服务器数 TB 带宽实现大规模加速计算,从而使专用 DPU 处理成为线速网络、存储和安全的关键。NVIDIA 正在推出 Scale-In 网络基础设施,这是 NVIDIA AI 网络的第五大支柱,可为代理式 AI 工厂的安全、管理和运营带来专门的加速。
Scale-In 可将NVIDIA BlueField-4和NVIDIA DOCA提供支持,并通过NVIDIA Spectrum-X 以太网连接,可加速服务,保护整个 AI 堆栈,并在 AI 工厂中移动应用、数据和存储流量。独立于主机的专用处理可将这些基础设施服务排除在主机 CPU 之外,有助于防止安全、数据访问和操作成为 AI 计算扩展时的瓶颈。其结果是更安全、更高效的共享 AI 基础设施,随着需求的增长,能够持续访问 AI 服务和数据。
本文将探讨 BlueField-4 架构,并解释 Scale-In 如何为代理式 AI 工厂提供安全访问、高性能数据移动、租户隔离、更简单的操作和更可预测的性能。
Scale-In 加速南北向 AI 工厂基础设施
AI 工厂在不同规模上有不同的基础设施需求:
- 纵向扩展: NVIDIA NVLink 将 GPU 作为统一的加速器。
- 横向扩展:NVIDIA Spectrum-X 以太网和 NVIDIA Quantum InfiniBand 可连接 AI 工厂中的服务器。
- 横向扩展: NVIDIA Spectrum-XGS 以太网连接分布式 AI 工厂。
- 上下文内存: NVIDIA CMX 基于 NVIDIA STX 模块化基础构建,用于 AI 原生存储,可在工厂内提供共享 KV 缓存存储。
- 扩展:NVIDIA BlueField-4、NVIDIA DOCA 和 NVIDIA Spectrum-X 以太网可加速与 AI 计算相关的访问、安全性、数据传输和基础设施运营。
南北向网络提供进出数据中心的访问路径,将用户、应用、数据源、存储系统和服务连接到各个系统。传统的云数据中心围绕软件定义的基础设施、可组合性和弹性构建这些网络,因此可以根据需求变化调配和扩展资源和访问权限。
代理式 AI 提高了对这种基础设施的需求。软件定义的网络、可组合性和弹性仍然至关重要,但它们已无法满足需求。AI 工厂将大规模加速计算与越来越多的用户、智能体、应用、企业数据源和存储系统结合在一起,并持续进行大规模交互。
基础设施必须作为 AI 工厂的一部分进行加速和共同设计。安全性、多租户网络、数据和存储访问以及基础设施运营不能仅依靠在通用主机 CPU 上运行的软件,也不能作为独立管理的层运行。这些功能必须作为一个统一的基础设施域协同工作,让操作员能够对整个 AI 工厂的访问、数据移动、安全性、调配和可观察性进行一致的控制。
Scale-In 通过将南北向访问发展为整个 AI 工厂中统一、加速的基础设施域来满足这些需求。BlueField-4 提供独立于主机的加速和卸载,DOCA 提供用于编程和运行基础设施服务的统一模型,Spectrum-X 以太网在 Scale-In 访问路径中提供高性能以太网连接,包括外部存储和数据源。它们共同助力运营商在支持加速计算和数据存储的基础设施中对访问、数据移动、安全性、调配和可观察性进行一致控制。

AI 工厂依靠互补的存储基础设施来处理持久性数据和推理上下文。Scale-In 提供对 AI 原生存储的高性能访问,包括用于训练、推理和分析的 AI 工厂存储,以及用于检索和多模态索引的企业 AI 数据系统。另外,CMX 为工厂内的共享 KV 缓存和可重复使用的推理状态提供 Pod 级存储。BlueField-4 既可用作 Scale-In 的基础设施处理器,也可单独用作 CMX 的数据和存储处理器。Scale-In 将 AI 工厂和企业数据连接到 AI 计算,而 CMX 则保留和共享上下文,以实现更快、更高效的推理。
这五大基础设施支柱共同满足了整个 AI 工厂的不同需求。只有在数据访问、存储、网络安全和运营随之扩展时,扩展 GPU、机架和数据中心才能带来价值。
BlueField-4 为扩展基础设施提供支持
BlueField-4 可加速跨 GPU 服务器、代理式 CPU 系统、AI 工厂存储系统和云服务的扩展服务。在 NVIDIA Vera Rubin NVL72 中,NVIDIA ConnectX-9 SuperNIC 通过 Scale Out 网络传输租户工作负载流量,而 BlueField-4 则运行和加速基础设施服务,以连接、保护和管理每台服务器。BlueField-4 为运营商提供了租户主机之外的独立基础设施处理域,他们可以在其中管理安全策略、服务状态和遥测,而无需依赖主机 CPU 或消耗其资源。
NVIDIA BlueField Astra 将可信控制从南北向访问扩展到东西向横向扩展网络。Astra 为服务提供商提供了一个独立于主机的统一控制点,用于跨两个域的调配、租户隔离和网络策略。BlueField-4 安装和更新策略并监控遥测,而 ConnectX-9 直接在数据路径中执行这些策略。这种闭环提供了跨 Scale-In 和 Scale-Out 的一致控制,无需在租户主机中放置设备管理。
BlueField-4 将可编程控制平面处理与加速数据路径处理相结合。软件做出基础架构决策,而内联引擎则在本地执行这些决策,而无需将工作返回主机 CPU。这种设计使整个工厂能够协调策略,并以线速在本地执行。表 1 总结了主要组件如何支持此处理模型。
| 组件 | 角色 | 优势 |
|---|---|---|
| 64 核 NVIDIA Grace CPU | 运行策略、调配、遥测和基础架构编排软件 | 提供比上一代产品多 6 倍的计算能力,使多个基础设施服务能够同时运行 |
| 内联加速引擎 | 进程数据包、RDMA、存储协议、加密、防火墙规则和策略执行 | 处理高达 800 Gb/s 的运算,同时减轻 Grace CPU 和主机 CPU 的处理负担 |
| LPDDR5X 内存子系统 | 为基础设施软件提供数据和服务状态 | 提供高显存带宽和节能高效的操作,而不会造成显存瓶颈 |
| PCIe Gen6 主机连接 | 将 BlueField-4 连接到主机服务器 | 在主机和扩展基础设施处理域之间提供高带宽路径 |
| 800 Gb/s 网络接口 | 将服务器连接到 Scale-In Fabric | 支持高吞吐量访问、安全性、数据移动和存储流量 |
与 BlueField-3 相比,BlueField-4 可提供 4 倍的内存带宽和 2 倍的网络带宽。这种额外的容量支持更多并发服务、更大的策略和遥测数据集,以及更高的流量处理和安全吞吐量。
NVIDIA DOCA 程序扩展服务
NVIDIA DOCA 将 BlueField-4 的硬件加速器转变为可编程和可部署的扩展服务。生产就绪型容器化 DOCA 微服务可以直接在 BlueField-4 上运行,而 DOCA 库和 SDK 允许开发者访问加速网络、安全、存储和遥测功能,以实现自定义服务。DOCA Flow 为硬件数据包处理工作流编程,DOCA PCC 支持可编程拥塞行为,DOCA Telemetry 公开设备和服务运行状况,DOCA Platform Framework (DPF) 管理调配、部署和更新。BlueField-4 的多服务架构和原生服务功能链通过所需的服务序列引导每个流量流。这些功能为跨 BlueField-4 系统操作服务提供了统一的软件模型,而无需管理单独的服务器工作流。
NVIDIA Spectrum-X 以太网连接扩展网络
NVIDIA Spectrum-X 以太网可在扩展访问路径中提供高性能网络,包括外部存储。BlueField-4 处理每个系统的基础设施服务,而 Spectrum-X 以太网在 AI 工厂与其周围的用户、应用、数据源、服务和外部存储之间传输流量。Spectrum-X 以太网可大规模解决负载平衡冲突和拥塞问题,提高资源利用率,帮助保持高效带宽,并隔离并发流量,从而使访问和存储流获得更一致、更可预测的性能。
BlueField-4 DPU、DOCA 微服务和 Spectrum-X 以太网网络与 NVIDIA Vera Rubin 共同设计,使处理器性能、内存带宽、PCIe 连接、网络带宽、加速和软件能够与时俱进。它们共同提供了一种可扩展的路径,可处理传输、服务处理和控制,而不会消耗分配给 AI 工作负载的资源。
代理式 AI 工厂的主要扩展用例
代理式 AI 工厂必须安全共享加速基础设施、为其提供企业数据、使系统上线,并持续监控性能。以下用例展示了 BlueField-4 加速和 DOCA 服务如何满足这些生产需求。
构建隔离的 AI 工厂虚拟私有云
AI 工厂虚拟私有云 (VPC) 可隔离共享物理基础设施上的租户和应用程序流量。DOCA 基于主机的网络 (HBN) 可在 BlueField-4 上加速南北 3 层路由和多租户隔离。DOCA Flow 程序的流量分类和访问控制规则,而 DOCA 加速的 Open vSwitch (OVS-DOCA) 在东西向接口上应用了相应的策略。BlueField Astra 在东西向横向扩展 (Scale-Out) 接口之间扩展了相同的 VPC 策略,因此只需一个策略模型即可控制访问和横向扩展 (Scale-Out) 流量。
在 Vera Rubin 中,此协调模型的聚合接口带宽为 7.2 Tb/s,其中南北 BlueField-4 路径的带宽为 800 Gb/s,每个计算托盘的路径为四个 1.6 Tb/s 的东西向路径。这可为访问和 Scale Out 流量提供一致的策略覆盖,而无需通过 800 Gb/s 接口路由所有东西向流量。运营商集中调配隔离的 AI 工厂 VPC,而租户则继续使用加速网络。此架构提供类似云的弹性、一致的隔离、更低的主机 CPU 开销,并更高效地使用共享 AI 基础设施。
在芯片中实现安全性
BlueField-4 将执行点置于主机操作系统之外的硬件中。租户软件无法禁用或绕过这些控制,而卸载安全处理可保留主机 CPU 周期并避免单独的软件跳跃。BlueField-4 可加速威胁检测,并以线速执行网络、文件和对象访问策略。DOCA Argus 提供运行时威胁检测,DOCA Vault 执行文件访问策略,DOCA Flow 程序线速网络执行。BlueField Astra 可跨服务器上的不同网络协调加密、隔离和策略。Astra 可跨南北向和东西向流量同步策略、遥测、密钥和执行,在租户主机之外保持特权安全控制,为共享 AI 服务提供一致的保护,并为 AI 工作负载保留主机资源。
加速存储访问
Scale-In 可将 AI 计算连接到训练数据、模型资产、企业知识和来自外部存储的应用数据。如果存储协议处理、存储虚拟化或数据移动无法跟上步伐,GPU 会在具有可用计算和 Scale-Up/ Scale-Out 网络带宽的情况下等待数据。
BlueField-4 可通过 RDMA 和 TCP 加速 NVMe-oF、文件和对象存储协议、存储虚拟化以及专用基础设施上的数据移动。Spectrum-X 以太网在整个存储路径中提供经过 AI 优化的以太网结构,其中拥塞管理和性能隔离有助于在并发存储流中保持高效带宽,存储吞吐量比现有以太网高 1.45 倍。这降低了主机 CPU 用度,有助于保持 AI 计算的供给,并提供对企业数据的更一致的访问,以进行训练、检索和推理。此外部数据路径是对 CMX 的补充。

运行 AI 工厂控制平面
在运行 AI 工作负载之前,必须对 AI 工厂节点进行置备、配置、保护和连接。BlueField-4 板载节点,调配网络和存储资源,启动服务器,并通过网络加载主机操作系统。由于此控制平面独立于主机运行,因此它会在租户软件启动之前制定策略并调配资源。DOCA 平台框架是一个 Kubernetes 原生编排框架,可调配、管理和扩展 BlueField DPU,并将其作为 Kubernetes 节点。它管理整个AI 工厂的 DPU 发现、调配、服务部署和更新。这样可以缩短部署时间、提高配置一致性、保留主机 CPU 资源,并更快地让新的 AI 能力上线。
观察并优化 AI 运营
大规模运营 AI 工厂需要持续监控网络流量、存储访问、服务运行状况、性能和资源利用率。DOCA Telemetry 收集这些信息并将其导出到网络监控平台,而 DOCA 库使可观察性提供商能够将相同的基础设施信号集成到他们自己的工具中。通过 BlueField-4 收集遥测数据,操作员可以独立于租户 – 主机软件保持可见性。当基础设施遥测扩展到 GPU 和网络利用率时,运营商可以识别与访问、流量、存储、策略执行或工作负载放置相关的限制条件。这种全车队可见性有助于检测异常、定位瓶颈,并在事件影响 AI 工作负载之前将其解决。
Scale-In 将扩展计算转化为 AI 工厂性能
Scale-In 可将南北向网络发展为协调、加速的基础设施域,用于数据访问、安全和运营。NVIDIA BlueField-4 提供网络加速、DOCA 程序和运营服务,而 Spectrum-X 以太网则在扩展访问和存储路径中提供高效的带宽和性能隔离。它们共同帮助将扩展计算转变为安全且可操作的 AI 工厂平台。
后续步骤
- 探索 NVIDIA BlueField 平台,了解产品架构、规格和资源。
- 详细了解NVIDIA Spectrum-X 以太网和NVIDIA DOCA 软件框架。
- 开始对 BlueField 进行编程:下载 NVIDIA DOCA,按照DOCA 入门指南进行操作,并构建DOCA 示例。