网络/通讯

NVIDIA Vera Storage 基准测试:加速 AI 原生存储的加密、压缩、完整性检查和恢复

存储是每个代理式 AI 工作流的积极组成部分。当智能体检索企业知识、访问持久内存、重复使用键值 (KV) 缓存数据、执行工具并生成新结果时,存储系统必须不断提供和保留移动智能体推理循环的数据。 

每个智能体步骤都可以触发多个存储操作,并且这些操作可以在数千个并发智能体中重复执行,上下文窗口也会变得越来越大。提供和保留这些数据需要的不仅仅是基本的读取和写入。AI 推理在 GPU 上运行,但代理式进程、工具调用、数据管理任务以及支持它们的存储服务在 CPU 上运行。 

在写入期间,存储可能会压缩和加密数据、计算校验和以及计算冗余。在读取期间,它可以验证、解密、解压缩或重建数据,然后再将其返回到应用程序。这些功能对于 AI 系统的安全性和弹性至关重要。当数据在存储路径中移动时,每个功能还需要额外的 CPU 处理。

随着智能体并发 (多个用户、AI 智能体或并行运行的任务) 和上下文量的增长,存储必须在不限制应用响应速度或 token 生成的情况下执行更多此类工作;它必须以加速计算所需的速率提供数据。 

其中许多函数直接位于数据路径中;一次延迟运算会减缓更广泛的数据流。使用传统 CPU 进行扩展可能需要更多的核心、功率和散热,从而增加基础设施成本,同时仍需依赖最慢的步骤来提高性能。如果处理器无法跟上数据安全、保护和准备的步伐,更快的固态硬盘和网络将无法充分发挥其潜力。

缩小存储处理差距

NVIDIA Vera BlueField-4 STX 存储处理器是面向 AI 原生数据平台的 NVIDIA STX 基础的关键组件,可将 NVIDIA Vera CPU 性能直接引入存储数据路径。旨在为 NVIDIA Rubin GPU 提供数据的 Vera CPU 架构也加速了 CPU 端存储处理。 

基准测试结果显示,Vera 在加密和解密、恢复、完整性检查、压缩和解压缩以及多阶段存储工作流方面的表现优于 x86 CPU。这些提升使存储平台能够处理更多数据并应用基本企业服务,同时降低 CPU 和功耗开销,而更高的压缩吞吐量有助于降低存储容量和带宽需求。

本文将介绍 BlueField-4 STX 中的 Vera CPU 如何加速代理式 AI 所需的存储处理,帮助 AI 原生存储平台保护、保护、验证和压缩更多数据,同时提高存储处理吞吐量和效率。

Vera CPU 架构:专为存储的双重需求而打造

Vera CPU 包含 88 个 NVIDIA 设计的 Olympus CPU 核心,这些核心与 Armv9.2 指令集完全兼容。CPU 支持 176 个 NVIDIA 空间多线程线程。它将这些核心与 NVIDIA 可扩展一致性结构 (SCF) 、Small Outline Compression Attached Memory Module (SOCAMM2) LPDDR5X 显存配对,以维持强大的单线程性能和 AI 工厂规模的高吞吐量 CPU 执行。 

SCF 提供跨核心、共享缓存、内存控制器和 I/ O 的一致裸片上数据路径,具有高达 3.4 TB/s 的对分带宽和 164 MB 的统一三级缓存。随着工作负载在处理器中的扩展,活动核心可对共享数据进行高带宽、可预测的访问。SOCAMM2 LPDDR5X 显存子系统可提供高达 1.2 TB/s 的总显存带宽,或高达 14 GB/s 的每个核心带宽,从而为带宽密集型和高度并发的工作负载提供 NVIDIA Olympus 核心。模块化、可现场替换的内存将 LPDDR5X 的能效与数据中心基础设施所需的可维护性和可靠性相结合。

存储基元对 CPU 有两种不同的要求。首先,在每个数据流中,必须快速完成加密、完整性检查、恢复、压缩和解压缩,然后才能继续进行后续存储处理,因此持续的每核心性能至关重要。其次,在整个系统中,这些操作在许多并发流上运行,并在缓存和内存中反复移动数据,因此带宽和可预测的延迟同等重要。

Vera 满足了这两个要求。Olympus 核心结合了宽指令吞吐量、高级分支预测、深度乱序执行以及向量和加密资源,可帮助每个核心在控制密集型代码和数据处理代码中维持指令吞吐量。

NVIDIA 空间多线程、整体式计算裸片、SCF、统一的三级缓存和高带宽 SOCAMM2 显存有助于为活动核心提供数据,同时减少线程之间的干扰,并在负载情况下支持更可预测的数据访问。这些功能有助于解释在加密、完整性检查、奇偶校验计算、压缩和多阶段存储管线中测量的收益。

这使得 BlueField-4 STX 存储处理器能够在并发数据流中维持更多 CPU 端存储处理,而不会按比例增加 CPU 资源、功耗和散热。

测量基础存储性能

存储任务在存储读取、写入和恢复路径中反复执行。其吞吐量和效率有助于确定 CPU 端处理是否与 SSD 和网络保持同步,或成为数据路径中的限制阶段。本文中的存储基元微基准测试隔离了这些函数,以衡量处理器的贡献。它们展示了 Vera 中的 CPU 性能和可用空间,可用于构建更高吞吐量、更高效的存储服务。

每个测试都使用内存中已有的数据在单个进程中运行。除非另有说明,否则这些测试不包括文件 I/ O、磁盘性能、网络、命令启动和外部设备瓶颈。基准测试集使用 OpenSSL、Zstandard 和 LZ4 等通用库,以及经过优化的类似实现,可使用 Arm 和 x86 处理器上提供的原生指令。

专门构建的测试框架能够始终如一地运行每个工作负载,并控制缓冲区大小、线程数量、CPU 放置、计时、正确性验证和结果收集。这些算法和许多软件实现被广泛采用。该测试框架在 Vera 和 x86 上应用相同的工作负载定义和控制,从而实现一致的处理器对比。虽然完整的基准测试集并非现成的公共基准测试,但可以使用源代码、脚本、固定软件版本、配置和结果文件再现结果。

这些测量结果确定了 Vera 在存储构建块上的性能,这些构建块会影响安全数据移动、弹性、容量效率和服务密度。生产存储路径通常会对同一数据应用其中几项运算,导致其 CPU 处理需求不断累积。 

在生产存储软件中结合使用时,这些单独操作的性能有助于提高总吞吐量和 CPU 效率。跨单个基元和多阶段工作流的更高吞吐量为存储软件提供了更多的 CPU 空间,以与 SSD 和网络保持同步,支持并发数据流,并高效地应用基本数据服务。仍需要进行端到端测试,以量化完整的存储系统或 GPU 性能结果。

通过更快的加密保护更多 AI 数据

AI 工厂处理敏感信息,包括模型资产、企业知识、智能体上下文、提示、输出和客户数据。AES-128 广泛用于静态数据和传输数据加密。加密直接位于写入路径中,在加密成为瓶颈之前,其吞吐量可以决定平台每秒能处理多少安全数据。Vera 可提供高达 1.43 倍的 AES-128 加密吞吐量 与用于比较的 x86 CPU 相比。

解密在读取路径上执行相应操作,而 Vera 提供的 1.29 倍 更高的 AES-128 解密吞吐量 比用于比较的 x86 CPU 高。

更高的加密吞吐量使存储系统能够在不限制写入的情况下保护更多数据,而更快的解密速度可减少将受保护的数据返回给智能体、应用或加速器所需的时间。这有助于存储系统保护和返回不断增长的 AI 数据,而不会消耗更多的存储性能预算。

更快地保护和恢复 AI 数据

当驱动器、节点或数据片段变得不可用时,存储平台使用擦除编码来保护数据。Reed-Solomon 编码会产生冗余,而恢复则使用这种冗余来重建丢失或损坏的数据。编码通常发生在写入路径上。在重建、修复或读取性能降低期间,系统会发生恢复。它们的性能结果可能有所不同,因为这些操作使用不同的计算和内存访问模式。

在恢复工作负载中,Vera 的 Reed-Solomon 吞吐量比 x86 CPU 高 3.26 倍。 

更高的 Reed-Solomon 吞吐量使存储系统能够更快地写入受保护的数据并重建丢失的数据。在选定的效率测量中,Vera 还在可用的 CPU 功率范围内完成了更多的保护工作,这有助于缩短重建时间,并减少与正常数据服务的争用。

以更高的吞吐量验证数据完整性

数据在移动、存储和检索时必须保持正确。循环冗余校验 (CRC) 会创建校验和,供存储系统用于检测意外损坏。

CRC 和 Reed-Solomon 发挥互补作用。CRC 检测到数据不再符合预期结果。Reed-Solomon 提供了用于重建缺失或损坏信息的冗余。

存储系统可以在写入和读取路径上计算 CRC,包括在缓冲区之间复制数据时。随着数据量的增长,这些检查可能会消耗大量 CPU 资源。

与 x86 CPU 相比,Vera 可提供高达 3.67 倍的 CRC32C 吞吐量。

更高的 CRC32C 吞吐量使存储系统能够验证更多数据,而无需进行完整性检查,从而限制读取或写入。对于代理式工作负载,这有助于返回可靠的上下文、持久内存和企业数据,同时减少 CPU 端处理延迟。

通过更快的压缩和解压缩减少数据占用

代理式 AI 会创建越来越多的上下文、日志、检查点、检索数据、中间输出和持久内存。压缩会降低这些数据所需的存储容量和移动数据所需的带宽。解压缩可在读取数据时进行恢复。压缩可能会在线运行,也可能会在写入数据后运行,具体取决于存储架构,而在读取压缩数据时通常需要解压缩。压缩吞吐量会影响降低数据的速度,而解压缩吞吐量会影响存储系统将数据返回至代理式 AI 应用的速度。以下基准测试分别测量这些运算。

Vera 提供的压缩吞吐量比 x86 CPU 高 3.29 倍,同时在测量的线程数方面保持其优势。

解压缩基准测试用于测量读取压缩数据时的相应操作。Vera 在并行情况下的解压缩吞吐量比 x86 CPU 高 1.72 倍,其优势随着更多的工作线程并行运行而增加。

压缩性能因算法、数据特性、压缩级别、缓冲区大小和线程数而异,因此这些结果特别适用于测量的工作负载。更高的压缩吞吐量使存储系统能够减少写入、存储和传输的数据量,同时保持 CPU 端处理性能。 

更高的解压缩吞吐量有助于存储系统更快地将解压缩后的数据返回给智能体和应用。这些功能共同降低了存储容量和带宽的压力,同时使每个处理器能够在代理式 AI 工作负载增长时压缩和解压缩更多数据。

加速多阶段存储写入路径

存储系统很少独立执行数据服务。安全的写入路径可以压缩数据以减少其占用空间,然后在写入之前对其进行加密。基准集包括内存驻留工作流,该工作流对每个数据缓冲区应用压缩和加密。与先前衡量单个操作的基准测试不同,当两个 CPU 密集型存储函数依次执行时,此测试会衡量总工作流吞吐量。

与用于两阶段压缩和加密工作流的基准测试中使用的 x86 CPU 相比,Vera 可提供高达 3.21 倍的工作流吞吐量。

该结果表明,Vera 的性能优势不仅限于之前测量的单个操作,还扩展到代表存储写入路径的多阶段序列,从而减少并保护数据。更高的多阶段工作流性能使存储系统能够处理每个处理器的更多数据,随着代理式 AI 数据量的增长,有助于维持写入吞吐量。

使用 Vera 扩展智能体执行和存储

代理式 AI 使 CPU 执行和存储处理成为同一 AI 工厂数据路径的一部分。

CPU 在模型调用之间运行工具、代码、检索、分析和数据处理步骤。存储系统可保护、保护、验证、压缩和返回这些步骤所需的数据。两者都必须在整个 AI 工厂可用的有限 CPU、功率和冷却资源内进行扩展。

Vera 旨在加速代理式 AI 时代依赖 CPU 的工作。在 NVIDIA Vera Rubin 中,它充当 NVIDIA GPU 的主机 CPU,并支持代理执行。在代理式工具中,Standalone Vera 可将每个核心的性能提升高达 1.8 倍。在 BlueField-4 STX 中,Vera 为 AI 原生存储平台使用的 CPU 端处理提供支持。

基准测试结果显示,Vera 可加速加密和解密以实现安全数据访问,Reed-Solomon 恢复可在存储重建和修复期间更快地重建丢失或损坏的数据,CRC32C 可用于高吞吐量完整性验证,压缩和解压缩可降低容量和带宽需求并加速数据检索。 

通过在多阶段写入路径中单独维持这些功能,Vera 可帮助 AI 原生存储平台以更少的 CPU 端延迟处理和返回安全可靠的数据。它还支持更多并发数据流和更高的服务密度,而不会在 CPU 资源、功耗和散热方面按比例增长。在选定的工作负载中,Vera 还可提供更高的每瓦性能,从而在可用处理器功率预算内实现更多 CPU 侧存储处理。

计算和存储领域的通用 Vera CPU 架构和软件工具链为扩展智能体执行和支持的数据基础设施提供了一致的基础。

详细了解 Vera CPU 和 BlueField-4 STX

标签