精选

NVIDIA Vera CPU:专为实现代理式 AI 的最大单线程性能而打造的 Olympus Core

代理式 AI 将更多的关键执行路径转移到 CPU 上。智能体在沙盒中执行代码、调用工具、检索上下文、与数据库交互,以及分析结果,然后再将信息返回至模型。随着这些循环在 AI 工厂中同时运行,CPU 性能逐渐决定了每个智能体的响应速度和整个工厂的吞吐量。

这会创建一个不同的 CPU 设计点。智能体工作负载依赖于:

  • 强大的单线程性能,即使在插槽完全加载时也是如此。
  • 每个核心有足够的内存带宽,可为多个活动执行上下文提供数据。
  • 并发下的延迟可预测,因此智能体步骤能够始终如一地完成。
  • 高效处理不规则控制流、长依赖链和指针密集型数据结构。

这些要求不同于传统的云 CPU 设计,后者通常优先处理更统一的工作负载的核心密度和吞吐量。相反,代理式 AI 在每个智能体循环中的连续、分支密集型和延迟敏感型软件路径上,更注重每线程的持续进度。

NVIDIA Vera CPU 专为此类工作负载而打造,其设计以 Olympus 核心为核心。本文将探讨 Olympus 核心架构、多线程方法、一致性结构、内存子系统,以及可在 AI 工厂规模下实现高单线程性能的安全纵向扩展连接。有关更深入的技术讨论,请参阅随附的 NVIDIA Vera CPU 白皮书

设计可实现最大单线程智能体性能的核心

Olympus 是通过跨 Vera Rubin 平台的极致协同设计开发的,涵盖 CPU、GPU、网络、存储、内存系统和软件。这种系统级方法使 NVIDIA 能够优化整个 AI 工厂,而不仅仅是孤立地优化 CPU。代理式 AI 和强化学习给 CPU 端执行带来了更大的压力,因此构建 Olympus 的目的是加速不规则、分支繁重且对延迟敏感的软件路径,这些路径日益影响端到端性能。

Olympus Core 是 NVIDIA Vera CPU 的计算引擎,从头开始设计,旨在为高度并发的 AI 基础设施工作负载最大化每个周期 (IPC) 的指令。它结合了高单线程性能、宽指令吞吐量、深度乱序执行和先进的内存加速技术,可高效执行代理式 AI、强化学习、数据分析和大规模软件工作负载。 

Olympus 由以下块组成,如图 1 所示。 

  • 前端:经过优化的分支预测器 
  • 中核:关键路径加速 
  • 执行引擎:复杂向量优化 
  • 缓存子系统: 延迟优化指令和数据路径

前端

Olympus 前端旨在为大型分支密集型软件堆栈的核心提供有用的指令。智能体运行时、解释器、编译器、图形分析和数据处理框架等工作负载通常会将大量指令占用空间与频繁的控制流更改相结合,从而导致执行资源未得到充分利用。为了应对这些挑战,Olympus 推出了先进的分支预测、高带宽指令获取和 10 宽解码引擎,该引擎可在每个周期为核心提供更多指令。

此方法的核心是 Olympus 分支预测子系统,该子系统包含一个神经分支预测器,旨在提高对具有统计学偏差的困难分支模式的准确性。通过减少错误路径执行并支持每个周期最多两个已采取的分支,它有助于在软件行为不规则时维持控制流吞吐量。结合宽解码路径,这些功能使 Olympus 能够为延迟敏感型工作负载 (包括高效处理复杂控制流至关重要的代理式 AI 和强化学习应用) 保持更高的前端吞吐量。

中核 

代理式工作负载通常遵循长链的依赖性工作:解释代码、遍历对象、管理运行时状态、处理工具输出以及处理类似图形的数据结构。在这些路径中,性能不仅取决于指令获取,还取决于核心发现独立工作的能力,而早期指令则等待分支、内存或依赖项解析。

Olympus 中间核心旨在揭示和加速这种隐藏的并行性。宽重命名和分配引擎可将解码指令映射到物理资源,而大型重排序缓冲区和广泛的物理寄存器容量可在运行中保留更多指令,从而实现更深层次的乱序执行。依赖关系中断功能 (包括内存重命名、值预测和关键路径加速) 有助于减少指针密集型代码、序列化内存操作和长依赖链造成的停顿。

这些功能共同保持了执行引擎的工作效率,改进了 IPC,并增强了智能体、RL 环境和现代 AI 基础设施中常见的不规则软件路径中的单线程性能。

执行引擎

代理式工作负载需要的不仅仅是广泛的前端。一旦指令进入核心,CPU 必须高效地执行不断变化的整数运算、分支、向量运算和内存访问组合,而不会造成新的瓶颈。传统的 x86 服务器 CPU 通常依赖于更高的时钟频率来提高单线程响应速度,但代理式工作负载经常受到不规则控制流、长依赖链和内存延迟的限制。这些挑战需要更高的 IPC,而不仅仅是频率。

Olympus 执行引擎可将宽指令供应转化为高效执行。它可以跨一系列整数、分支、向量、浮点、加密、加载和存储资源动态调度运算,并由广泛的后端和深度乱序执行提供支持。这种平衡的设计有助于 Olympus 高效处理分支密集型软件、矢量化数据处理、AI 预处理、加密、压缩、分析和其他内存密集型工作负载。

缓存子系统

智能体通常会在缓存中不完全适合的数据结构上运行,包括运行时对象、检索索引、工具状态、图形结构、稀疏数据、数据库和环境内存。传统的缓存和预取设计非常适合常规的流式访问模式,但当每个地址都依赖于之前的内存查找结果时,效果就会降低,这在指针密集型和图形类智能体工作流中很常见。

Olympus 缓存子系统旨在减少这些卡顿,并为执行引擎提供指令和数据。它结合了深度缓存层次结构、内存消除歧义和多个硬件预取引擎。Olympus 还包含一个图形预取程序,旨在提高数据密集型图形和分析工作负载的性能。 

这些功能共同降低了有效内存延迟并提高了内存级并行性,帮助智能体、图形分析和数据处理工作负载减少了等待不规则内存访问的时间,并将更多时间用于完成有用的工作。

专为工具调用和强化学习而设计的多线程创新 

多线程对于智能体工作负载非常重要,这些工作负载通常是突发的、由事件驱动的,并且与后台系统活动交织在一起。典型的沙盒可能会运行主要执行路径,同时处理异步 I/ O、计时器、运行时服务、网络、日志记录、内存管理和工具编排。第二个硬件线程使 CPU 能够在本地吸收这种支持工作,从而提高利用率和响应速度,同时降低主代理线程必须放弃、迁移或等待的频率。

传统的同步多线程 (SMT) 通过允许两个硬件线程共享一个核心来提高利用率,但这种共享可能会导致冲突。在密集线程沙盒环境中,线程可能会争夺分支预测、解码带宽、执行资源、加载/ 存储容量、缓存和内存带宽。这会在核心内产生噪邻效应,其中一个线程上的活动会降低另一个线程的性能。对于代理式 AI、RL 环境和云服务而言,这种可变性很重要,因为尾部延迟会直接影响吞吐量和服务质量。

Vera CPU 通过 NVIDIA 空间多线程 (SMT) 采用不同的方法。广泛的 Olympus Core 旨在在两个硬件线程之间更有效地分配资源,而不是仅仅依靠机会性资源共享。这使得 Olympus 能够在需要最高的每线程性能时作为高吞吐量单线程核心运行,与同类线程处理管理活动一起运行,或者在需要更高的线程密度时作为两个更独立的执行上下文运行。

其结果是强大的每线程性能、更高的利用率以及负载下更可预测的行为。凭借 88 个 Olympus 核心和 176 个 SMT 线程,Vera CPU 可以支持大量并发智能体任务,同时减少线程之间的干扰,并提供更一致的延迟和吞吐量。

借助一致的网络和高带宽内存,保持代理式 AI 性能

只有当处理器的其余部分能够保持供电时,高 IPC 核心才会提供其全部价值。代理式 AI、强化学习、图形分析和数据处理工作负载通常依赖于大型工作集和不规则的访问模式,因此网络带宽、缓存访问、内存带宽和延迟与执行宽度同样重要。

Vera CPU 将 Olympus 核心与 NVIDIA 可扩展一致性结构 (SCF) 和 SOCAMM2 ( Small Outline Compression Attached Memory Module,Small Outline Compression Attached Memory Module) LPDDR5X 显存配对,为 AI 工厂规模的高吞吐量 CPU 执行创建了一个更加平衡的平台。

NVIDIA 可扩展一致性结构

NVIDIA 可扩展一致性结构是 Vera CPU 通信主干,通过一致性、高带宽的裸片结构连接 Olympus 核心、共享缓存、内存控制器、I/ O 和 NVLink-C2C 接口。它提供高达 3.4 TB/s 的对分带宽,并在所有核心中集成了 164 MB 的统一三级缓存。通过将缓存和网络资源放在整体式计算芯片上,Vera CPU 避免了碎片化小芯片设计中常见的裸片延迟和可变性,支持在整个处理器中对共享数据进行更可预测的访问。

对于经常交换状态、遍历共享数据结构以及在运行时、检索、分析和编排代码之间切换的智能体工作负载而言,这一点尤为重要。SCF 有助于减少争用、改进缓存共享,并在 CPU 资源之间保持一致性访问,同时作为 NVLink-C2C 连接到 GPU 和纵向扩展平台的集成点。

SOCAMM2 LPDDR5X 显存

Vera CPU 使用 SOCAMM2 LPDDR5X 显存提供 AI 基础设施所需的带宽、效率和容量。内存子系统可提供高达 1.2 TB/s 的总带宽,或每个核心高达 14 GB/s 的总带宽,帮助每个 Olympus 核心在高并发情况下持续开展有用的工作。与基于传统 DDR5 和 MRDIMM 的服务器设计相比,SOCAMM2 LPDDR5X 可在显存功耗大幅降低的情况下提供这种带宽,从而降低平台功耗,同时为带宽密集型 AI、分析、图形和 RL 工作负载提供核心。

SOCAMM2 还为 LPDDR 内存带来了企业级可维护性。Vera CPU 不是使用降低焊接的 LPDDR,而是使用模块化、可现场替换的内存模块,保留高速 LPDDR5X 所需的短电气路径,同时支持数据中心部署模型。因此,内存架构结合了高带宽、高能效以及广泛的可靠性、可用性和可服务性 (RAS) 功能,这些功能对于在整个 AI 工厂中扩展 CPU 性能至关重要。

更快、更安全、更大规模地移动代理式 AI 数据

高性能 CPU 必须执行的不仅仅是快速执行指令。它还必须在 AI 工厂中安全高效地移动数据。现代 AI 系统依靠 CPU 来协调加速器、内存、存储、网络和其他处理器,从而使纵向扩展连接和 I/ O 带宽成为整体系统性能的核心。

Vera CPU 将一致的 NVIDIA NVLink-C2C、双插槽扩展、PCIe 6.4、CXL 3.1 和机密计算整合到一个平衡的平台架构中。这些功能支持在新一代 AI 基础设施中安全、高带宽的数据传输。

双插槽扩展 

Vera CPU 使用第二代 NVLink-C2C 实现高带宽插槽到插槽连接,可从单插槽部署扩展到连贯的双插槽平台。这使得两个 CPU 能够作为一个统一的系统运行,具有一致的数据共享和可预测的纵向扩展性能,同时为 AI 工厂、HPC 和企业计算中的大型 CPU 工作负载保留更简单的软件模型。

传统的 x86 服务器 CPU 通常使用基于小芯片的设计,可以在每个插槽中显示多个 NUMA 域。在大型双插槽系统中,这可能会形成碎片化的内存拓扑,需要软件仔细放置线程、内存和 I/ O 流量,以避免远程访问、额外的裸片跳和不均匀的延迟。

Vera CPU 采用软件优先的方法。每个插槽显示为单个 NUMA 域,从而在双插槽系统中创建清晰的双 NUMA 节点拓扑。它围绕一个整体式计算裸片、统一的系统级缓存和一致的结构构建,可减少拓扑驱动的可变性,并避免因跨越多个裸片而产生的开销。最终打造出一个双插槽平台,更易于编程和调整,可针对代理式 AI、RL、分析和企业工作负载实现更可预测的扩展。

IO 连接 

它包含 PCIe 6.4,可实现与新一代网络、存储、加速器和外围设备的高带宽灵活连接。双插槽配置提供 176 个 PCIe 通道,支持广泛的平台设计。Vera CPU 还支持 CXL 3.1,可实现一致的内存扩展、内存池化和可组合基础设施,适用于受益于更大内存占用的工作负载。

机密计算 

Vera Rubin NVL72 将机密计算扩展到扩展的 AI 基础设施中,保护跨 CPU、一致性 GPU 和互连的正在使用的数据,而无需不必要的数据复制或反弹缓冲区。Vera CPU 基于具有每个 VM 加密密钥的 Arm CCA/ RME 构建,提供机密 VM 隔离,支持安全分配支持 TDISP 的一致性设备,并使用经过身份验证的 C2C 加密来保护一致性链路上的数据。这些功能共同建立了一个统一的信任域,用于从服务器到机架扩展的安全 AI 工作负载。

提供领先的代理式工作负载性能

有了 Olympus 核心和网络、SOCAMM2 LPDDR5X 内存和双插槽纵向扩展架构,下一个问题是这些设计选择如何转化为代理式工作负载性能。代理式系统在 Python 执行、代码编译、静态分析和工具驱动型软件工作流方面花费大量 CPU 时间。这些软件路径会对较大的指令占用空间、分支密集型控制流、动态运行时行为和长依赖链造成压力。

关键指标是全插槽负载下的单线程性能。代理式 AI 和强化学习通常同时运行许多沙盒、工具和环境。每个智能体步骤都依赖于强大的每线程进度,但该进度必须保持不变,因为整个 CPU 共享插槽级功耗、缓存、内存带宽和网络资源。因此,加载单线程性能可在 AI 工厂规模下提供更具代表性的智能体吞吐量、响应速度和 CPU 端效率衡量标准。

如需详细了解 NVIDIA Vera CPU 架构和性能,请参阅 NVIDIA Vera CPU 白皮书

在 2026 年 7 月内部测量的 SPEC CPU = 2026 结果。有关性能测量和配置的详细信息,请参阅NVIDIA Vera CPU 白皮书

SPEC®、SPEC CPU® 和 SPECrate® 是 Standard Performance Evaluation Corporation (www.spec.org) 的注册商标。

标签