精选

利用 NVIDIA Vera CPU 应对智能体 AI 集群面临的挑战

AI 工厂是互联系统,其中集群经济性取决于整个堆栈将电力和资本转化为已完成智能体任务的效率。GPU 运行模型时,CPU 会处理编排、工具执行和沙盒计算。与具有稳定运行时配置文件的传统计算不同,代理式工作负载不可预测且高度可变。根据对 163594 个代理式会话的遥测,超过 97% 的会话显示了独特的轨迹轮廓 (图 1) 。这种可变性使得使用多个专用 CPU 设计点来合理调整集群规模变得不切实际。

生产级遥测还揭示了这些不同的轨迹:在各个会话中,执行遵循漫长而连续的推理链,并穿插着并行工作的零星爆发。这些真实数据表明,主要的顺序路径受到严格的延迟限制 (控制着整体会话完成时间) ,而瞬态扇出则需要结合使用可用的线程并发和低延迟的每线程执行。

AI 工厂需要一个平衡的 CPU 设计点,而不是通过围绕孤立的工具调用场景进行规划来分散集群。NVIDIA Vera CPU 专为实现这种平衡而构建,可在典型的代理式工作负载上提供出色的单核性能,从而在吸收间歇性扇出脉冲的同时加速关键路径。以下各节将研究这些智能体轨迹背后的遥测技术,并展示 Vera CPU 的平衡架构如何优化现实世界中的集群经济。

沿着智能体轨迹的关键路径进行优化

代理式轨迹的形状由其长度和宽度定义 (图 2) 。

  • 长度:在代理决定回合之前,需要执行多少推理步骤、工具调用、重试和子任务。
  • 宽度:每个阶段有多少工作风扇,包括并发工具调用、检索操作、沙盒或子智能体。

会话可能具有相当大的宽度,并且仍然需要大部分时间在连续链上等待,因为并行爆发是瞬时的,而底层依赖链在整个运行过程中一直存在。即使在大范围扇出的情况下,每个线程的延迟仍然至关重要。主代理经常闲置,直到这些并行任务完成,然后再推进到下一步。CPU 集群必须针对整个轨迹进行优化:提供足够的并发性以吸收扇出爆发,同时提供所需的强大的每线程性能,以加速最终决定端到端完成时间的顺序路径。

因此,代理式 CPU 集群的相关优化目标是已完成的用户会话总数,而非原始核心数量。高核数量系统在纸上可能看起来很高效,但它们往往需要权衡取舍。为了达到核心密度目标,它们牺牲了所需的单线程性能,以更大限度地减少智能体关键路径上的延迟。

当强制在性能较低的核心上运行这些对延迟敏感的顺序任务时,或者当它们在大规模并行、异构集群中遇到高同步开销时,代理工作流会受到影响。适用于智能体工作负载的均衡 CPU 必须搭配足够的核心,以吸收并发工具执行和子智能体扇出,同时具有强大的单线程性能,从而加速控制智能体总延迟的顺序步骤。

真正的智能体会话是什么样子

可以使用真实智能体遥测技术对此进行测试。在图 3 所示的现实世界克劳德代码会话中,主代理在 33 分钟运行的大部分时间内都会经历很长的连续轨迹。

遥测数据显示了代理式工作负载形状的两侧:有意义的扇出和长依赖项链。子智能体活动会产生一系列必须快速完成的并行工作,但完整的用户回合仍然通过有序的主要轨迹推进,其中每个步骤都可以解锁下一个步骤。因此,CPU 集群需要足够的并发性,以便毫不迟延地吸收风扇爆发,同时在决定端到端完成时间的延迟敏感型路径上保持强大的每线程性能。

在任何特定时刻,CPU 都可以有效地“关闭”核心以暂时提升单线程性能。这可能会导致每个核心未使用 8 GB,并导致显存 TCO 大幅降低 (图 4) 。均衡的 CPU 设计针对整个工作负载轨迹进行了优化,而非孤立地针对任何单个阶段进行优化。通过将强大的每线程响应能力与有意义的并发性、充足的内存带宽和高效的功耗相结合,这种方法可以更大限度地提高用户的周转率,同时高效地使用 CPU 核心、DRAM、GPU HBM 和更广泛的内存层次结构。

Vera CPU 如何实现这种平衡

Vera CPU 专为此操作点而构建,NVIDIA Olympus 核心旨在在整个 CPU 处于活动状态时保持强大的每线程性能。宽前端、高级分支预测、深度乱序执行和高带宽内存子系统可帮助每个核心在大型代码占用空间、分支密集型控制流、动态运行时和依赖性密集型执行中保持向前推进。上面的克劳德代码数据表明,代理式工作负载需要同样的平衡:并发性来吸收扇出,以及每线程速度来保持主要的顺序路径移动。

图 5 中估算的 SPEC CPU* 2026 结果测试了该设计点。NVIDIA Vera CPU 突出显示了 Vera CPU 在典型代理式工作负载 (包括编译器、静态分析和 Python 基准测试) 中的单核负载性能,并展示了 Olympus 如何在不牺牲代理关键路径所需性能的情况下处理并发,可提供高达最新比赛 1.5 倍的代理式性能。

一个理想的代理式集群只需要一个 CPU 设计点

Vera 为代理式 AI 集群提供了更高效的 CPU 基础,因为它是为各种真实智能体轨迹而构建的。在全插槽负载下,强大的单线程性能可保持延迟敏感型顺序路径的移动,而跨核心的高并发性和充足的内存带宽可吸收间歇性工具调用和子代理扇出。Vera CPU 的低延迟整体架构进一步减少了拓扑驱动的停顿和这些阶段之间的可变性。

这种平衡的设计有助于避免资源搁浅:在连续工作和并行突发期间,核心可保持高效,附加于这些核心的内存可得到有效利用,而不会被未充分利用的计算所束缚。它还减少了在多个专用 CPU 设计点之间划分集群的需求,以适应不可预测的工具调用模式。

其结果是一个 CPU 平台,可将计算、内存带宽和功耗转换为更完整的智能体,从而大规模改善 AI 工厂输出和集群经济性。

如需详细了解 NVIDIA Vera CPU 架构和性能,请参阅 NVIDIA Vera CPU 白皮书

在 2026 年 7 月内部测量的 NVIDIA Vera SPEC CPU® 2026 结果。有关性能测量和配置的详细信息,请参阅此NVIDIA Vera CPU 白皮书。AMD Venice 的结果基于链接。Venice 的单个工作负载性能基于 SPECrate = 2026_int_base score 2070 估算,组件则基于内部 Turin 测量值进行标准化。结果可能会有所不同。

SPEC®、SPEC CPU® 和 SPECrate® 是 Standard Performance Evaluation Corporation (www.spec.org) 的注册商标。

致谢

这项工作得益于 Ivan Goldwasser、Diana Aung、Hannah Coutand、Ian Finder、Benjamin Klieger、Arnav Jaiswal、Dylan Mitic 等人的专业知识和见解。

标签