网络/通讯

借助 NVIDIA BlueField 实现极致协同设计,扩展代理式 AI 工厂

代理式 AI 改变了 AI 工厂的基础设施模式。在生成最终答案之前,一个请求可以触发多次模型调用、工具调用、内存查找、策略检查、存储访问和网络传输。随着越来越多的智能体同时运行并跨步骤、用户、工具、服务和会话传输上下文,基础架构必须以足够快的速度移动、保护、检索和重复使用数据,以保持 GPU 和 CPU 的工作效率。 

NVIDIA BlueField 平台在 AI 工厂数据路径中实现了专用的可编程基础设施处理。BlueField 可分流主机 CPU 上的基础设施工作,加速数据移动,内联执行策略,并实现上下文重用。这些功能有助于实现更高的 GPU 利用率、更可预测的延迟、更强的隔离能力、更低的每 token 成本以及更多的每瓦 token。

它将专用基础架构和存储处理器与适用于 AI 工厂的 NVIDIA DOCA 软件相结合。NVIDIA BlueField-4 DPU 可卸载、加速和隔离主机 CPU 中的网络、存储、安全、遥测和控制平面服务,同时加速跨 GPU 计算和 CPU 计算系统的数据传输。NVIDIA Vera BlueField-4 STX 存储处理器 为新型数据平台提供动力支持,适用于 AI 工厂中的上下文内存、高性能存储基础设施和安全数据服务。

在这些处理器中,NVIDIA DOCA 为构建和运行这些服务提供了软件基础,涵盖网络、存储、安全、遥测和生命周期管理。在 NVIDIA Vera Rubin 平台和更广泛的 AI 工厂 NVIDIA DSX 架构中,BlueField 提供加速基础设施,而 DOCA 提供可编程软件模型,用于在数据中心部署这些服务。

本文将介绍代理式 AI 和长上下文推理如何推动新的基础设施需求,以及 BlueField-4、Vera BlueField-4 STX 和 DOCA 如何通过在 AI 工厂数据路径中卸载、加速和隔离基础设施服务来满足这些需求。

代理式 AI 使基础设施成为推理的一部分

代理式 AI 将推理从模型执行扩展到涵盖 GPU、CPU、内存、网络、存储和安全的分布式工作流。每个步骤都依赖于在整个 AI 工厂中移动数据、保留上下文、执行策略和协调服务,从而使基础设施数据路径成为推理工作流的一部分。 

GPU 执行模型推理并生成 token,而 CPU 通过执行工具、处理检索结果、准备提示、验证输出和协调后续推理步骤来编排智能体运行时。基础设施还必须保留和检索使推理能够继续进行的上下文。

保留和检索上下文对于 KV 缓存尤为重要。在预填充期间,LLM 会创建用于存储中间注意力状态的 KV 缓存数据。随着提示、对话和智能体工作流的增长,缓存状态必须在推理步骤中持续存在,并在请求中重复使用。当 GPU 显存受限时,系统会驱逐并重新计算 KV 缓存、限制上下文长度或将状态移动到另一个显存层,从而在延迟、吞吐量或成本方面进行权衡。这使得 KV 缓存成为基础设施数据路径的一部分,必须在其中移动、放置、保护和检索 KV 缓存,而不会降低推理速度。

因此,基础设施不再与推理相邻。基础架构现已成为推理工作流的一部分。网络、存储、安全、遥测、控制平面服务和上下文内存管理必须处理代理流量,而不会延迟 GPU 推理或消耗代理执行所需的主机 CPU 资源。

BlueField 为 AI 工厂的操作系统提供支持

代理式推理依赖于快速、安全且可编程的基础设施数据路径。BlueField 为该路径提供专用的基础设施处理器,用于连接、保护、隔离和加速整个 AI 工厂的服务。 

BlueField-4 在 Rubin GPU 和 NVIDIA Vera CPU 中用作数据处理单元 (DPU) ,而 Vera BlueField-4 STX 存储处理器则为 NVIDIA CMX 提供上下文内存和 AI 原生存储。在这些角色中,BlueField 将高速网络、嵌入式基础设施计算、本地内存、PCIe 连接、内联加速、隔离和 DOCA 可编程性整合到协调的 AI 工厂数据路径中。

BlueField-4 DPU 集成了高达 800Gb/s 的以太网或 InfiniBand 连接、64 核 NVIDIA Grace CPU、高带宽 LPDDR5X 显存、PCIe Gen6、用于网络、存储、安全和数据传输的在线加速,以及 DOCA 软件平台。 

与 BlueField-3 相比,它将网络带宽提高了一倍,提供高达 6 倍的计算性能、4 倍的内存容量和 3 倍以上的内存带宽。 

BlueField-4 STX 存储处理器结合了 NVIDIA Vera CPU、NVIDIA ConnectX-9 SuperNIC、高达 1.6 Tb/s 的 Spectrum-X 以太网连接、高性能 NVMe 存储访问、加速数据移动、芯片内安全性和 DOCA 可编程性。

DOCA 使 BlueField 基础设施处理域可编程,并为通过库和微服务构建和部署加速基础设施服务提供软件基础。随着 KV-cache 重用、租户隔离、存储元数据、拥塞控制、安全调配和新的代理式运行时模式的需求发生变化,它为开发者、运营商和 ISV 提供了一种一致的方式来创建和运行 BlueField 和 ConnectX 加速的服务。

BlueField 的系统级功能

只有当嵌入式计算、内存带宽、PCIe、加速和软件能够以相同的速度处理流量时,网络才能提高交互性。只有当额外的计算具有足够的内存容量、I/ O 带宽和可编程服务时,才能提高吞吐量。BlueField 经过联合设计,可平衡这些资源,以便在基础设施流量到达的地方进行处理。 

高速连接将 AI 工作负载、存储、安全和控制流量引入 AI 工厂数据路径。BlueField 的嵌入式计算和节能高效的 LPDDR5X 显存使服务逻辑和状态更接近正在处理的数据,包括队列、策略、元数据、遥测和 KV 缓存放置。PCIe Gen6、VirtIO 和 DOCA SNAP 存储虚拟化使主机能够使用由 BlueField 加速支持的标准主机可见网络和存储设备模型,从而降低主机 CPU 开销。 

当智能体请求通过 AI 工厂时,它们通过数据包进行传输,并触发 RDMA 传输、存储命令、策略检查、元数据查找和遥测事件。BlueField 可加速相关的流转向、数据移动、存储访问、加密、完整性和策略执行,因此基础设施服务可以与智能体流量保持同步,而不会消耗主机 CPU 资源。

DOCA 将此硬件基础转变为 AI 工厂的可编程服务,包括:

  • DOCA 基于主机的网络 (HBN): 支持服务器端第 3 层路由,而 BlueField 可充当可扩展多租户设计的 BGP 路由器。
  • BlueField ASTRA: 支持 Spectrum-X 零信任、多租户裸机部署,并借助 ConnectX-9 将 BlueField 用作跨多个基础设施平面的托管控制点。
  • DOCA 备忘录: 帮助跨计算和存储节点管理和共享 KV 缓存,以便在长上下文和代理式推理中重复使用上下文。
  • DOCA 安全服务: 支持零信任访问、策略实施、运行时可见性和隔离,以保护整个 AI 工厂的数据、推理和智能体。

这些功能共同使网络、存储、安全、上下文管理和控制服务靠近数据路径,而不是争夺主机 CPU 资源。这有助于 BlueField 提高 GPU 利用率、降低推理延迟、加强多租户隔离、降低每个 token 的成本,并提高 token 的每瓦性能。

Vera Rubin AI 工厂中的 BlueField-4

极致协同设计意味着 AI 工厂被设计为一个相互依赖的系统。每个组件都有一个明确的角色来补充其他组件,使平台能够在生产工作负载下保持吞吐量、交互性、隔离性和 token 效率。 

Vera Rubin 平台专为需要高吞吐量推理、密集型 CPU 执行、大规模上下文内存和安全数据移动的代理式 AI 工作负载而构建。在此平台中,Rubin GPU 提供加速计算,Vera CPU 支持工具调用、编排和数据移动。NVLink 提供纵向扩展通信,而 ConnectX-9 和 Spectrum-X 支持横向扩展网络。BlueField 可在整个系统中运行,涵盖计算、网络、存储和安全 (图 1) 。

GPU 计算:保护和加速 Rubin GPU

GPU 性能取决于整个系统向加速器提供工作、数据和安全连接的能力。BlueField-4 在 GPU 计算托盘中作为基础设施处理器运行。它支持前端 (南北) 网络、主机 CPU 卸载、安全数据访问、管理、可观察性和基础设施隔离。通过卸载和隔离这些服务,BlueField 有助于避免 GPU 计算受到主机 CPU 开销、可变访问控制或管理流量的限制。

南北向路径对于 GPU 至关重要,因为它将用户请求、检索到的数据、上下文、存储流量和管理服务引入 Rubin 计算层。BlueField-4 可扩展并保护该前端路径,而内联基础设施处理则在占用主机 CPU 周期之前处理相关的网络、存储、安全和遥测工作。更高的前端带宽和更低的主机 CPU 争用有助于改善 GPU 的数据和上下文可用性,支持更可预测的推理延迟,并提高 AI 工厂中每个用户的每秒 token 数。

CPU 执行:将基础设施与 Vera 代理式工作负载隔离开来

代理式 AI 和强化学习增加了对 CPU 性能的需求,因为代理执行工具调用、运行代码、浏览或查询数据、转换输入、解析输出、评估结果和编排工作流。Vera CPU 结合了高单核性能、并发性和节能高效的内存带宽,可在 AI 工厂规模下运行此 CPU 执行层。BlueField-4 为 Vera CPU 工作负载提供基础架构处理层,处理前端网络、存储访问、安全和隔离、调配、策略、遥测和管理。

这种分离很重要,因为代理式 CPU 工作负载位于推理循环中。如果基础设施服务占用主机 CPU 周期或增加调度抖动,则即使在 GPU 计算可用的情况下,工具执行、检索和验证也会减慢速度。BlueField 在 DPU 域中处理网络、存储、安全和控制平面服务,使 Vera CPU 能够在智能体执行上花费更多时间,而在基础设施工作上花费更少的时间。

AI 原生存储和上下文记忆

代理式 AI 可将上下文转化为活跃的基础设施数据。多轮智能体、长上下文推理、检索增强工作流程和多智能体系统会生成可重复使用的推理 (包括 KV 缓存) ,必须在不阻碍推理的情况下存储、共享、保护和检索这些推理。

NVIDIA CMX 上下文内存存储平台创建了一个可共享、可扩展且节能高效的 AI 原生存储层,用于 GPU 内存和可扩展共享存储之间的推理上下文。它提供了一个以太网连接的闪存层,使用 Vera BlueField-4 STX 存储处理器针对 KV 缓存进行了优化,该处理器结合了 Vera CPU、ConnectX-9 网络和 DOCA Memos。 

存储处理器在靠近存储和网络路径的位置运行 KV I/ O、元数据管理、数据放置、安全和控制操作。它不会将闪存呈现为块存储,而是会跟踪 KV 元数据、管理队列、支持缓存召回和预暂存、执行租户策略并处理数据保护。将这些控制密集型、延迟敏感型操作置于存储处理器中,有助于随着上下文的发展保持交互性。

借助 DOCA Memos,CMX 可以在 AI 计算和 CMX 数据节点之间管理和共享 KV 缓存,使其成为主动上下文内存数据路径,而非被动存储层。KV 缓存重用可减少重复预填充、上下文重新计算、GPU 空闲时间和不必要的数据移动,提高长上下文和代理式工作负载的每秒 token 数和能效。

为数据、推理和智能体提供芯片内保护 

代理式 AI 改变了安全模型,因为智能体会反复访问 AI 工厂中的数据、模型、工具、上下文内存和推理服务。在生成最终答案之前,他们可能会处理专有或受监管的数据、模型状态、嵌入和 KV 缓存。这使得数据、推理和智能体行为成为安全表面的一部分。

AI 工厂的安全性不能仅仅依靠主机软件。主机 – 居民安全控制与其保护的工作负载共享资源和信任边界,这可能会使它们在主机受到入侵时遭到篡改或规避。BlueField 可在芯片内和主机工作负载域之外进行安全处理,从而强化控制边界,同时为 AI 工作保留 CPU 和 GPU 资源。

对于多租户 AI 工厂而言,这可在不减慢数据路径速度的情况下实现在线保护。BlueField 提供了一个可信的基础设施控制点,用于跨计算、存储和推理基础设施的租户隔离、网络策略执行、安全访问、运行时检测、加密和遥测。DOCA 通过面向零信任数据访问、推理保护、智能体行为可见性和网络级隔离的可编程服务扩展了该模型,有助于保护智能体工作负载扩展时的模型、数据集、上下文内存和运行时交互。

了解详情

代理式 AI 使基础设施成为推理工作流的一部分,要求 AI 工厂在不降低 GPU、CPU 或上下文内存速度的情况下移动、保护、检索和重复使用数据。BlueField 为网络、存储、安全、遥测和上下文服务提供加速的基础设施处理,而 DOCA 则使这些服务在整个数据中心内可编程和可部署。BlueField-4、Vera BlueField-4 STX 和 DOCA 共同帮助 AI 工厂提高交互性、隔离性、GPU 利用率、每 token 成本和每瓦 token 的性能。

开始使用

下载 NVIDIA DOCA,安装最新版本,并构建 示例,开始对 BlueField 进行编程,以加速网络、存储、安全、遥测和生命周期管理。

标签