AI 智能体已将推理从单轮交互扩展到多步骤工作流,这些工作流能够进行推理、调用工具、协调子智能体,并将不断增长的上下文从一个回合带到下一个回合。这种转变的规模现在在原始消费中显而易见:在实际使用的 100 万亿个令牌中,OpenRouter 的 AI 现状报告发现,每个请求的平均提示令牌大约增长了 4 倍,而单个代理请求消耗的令牌是普通聊天的 15 倍。
正确描述此工作负载的硬件性能带来了新的挑战。实用的基准测试必须捕获长上下文预填充、KV 缓存重用、交互式解码、工具调用差距以及现实并发下的分布式混合专家 (MoE) 执行。它还必须显示在保持可接受的用户体验的同时,有多少 AI-factory 功耗预算已转换为有用的代理式吞吐量。
本文将探讨 SemiAnalysis AgentX,该基准测试使用回放的生产级会话评估用于代理式编码推理的 AI 基础设施。其中重点介绍了 Vera Rubin NVL72 预览结果显示,每兆瓦 AI 工厂吞吐量比 GB300 NVL72 高 30 倍,同时表明 Blackwell GB300 NVL72 将其每兆瓦吞吐量的数量级优势扩展到了动态代理式工作负载,与前几代产品相比,达到了数量级优势。
什么是 AgentX?
AgentX 是 InferenceX ( SemiAnalysis 的开源基准测试套件) 中的代理编码基准测试。它衡量加速器如何高效地服务于真实编码代理生成的请求模式。
AgentX 测试和测量方法
智能体会话很长、有状态且可变:它们关联模型调用、工具使用和不断增长的上下文,而不是遵循固定的提示和响应模式 (下方图 1) 。因此,AgentX 可衡量平台是否能够响应式提供回放的智能体流量、重复使用之前处理的上下文,以及更大限度地提高每调配兆瓦的智能体吞吐量。

下图 2 显示了 DeepSeek-R1-0528 的旧版 InferenceX 静态 8K/ 1K 序列长度结果。GB300 NVL72 使 H200 每兆瓦的 token 数量增加了 40 倍。但是,该场景代表受控、固定长度的服务,而不是由智能体在生产环境中生成的流量。

在真实智能体会话中,请求长度依次变化。上下文在整个任务中不断累积,之前处理过的 token 可以重复使用,模型调用也会因工具执行或委托工作而中断。随着代理式 AI 成为领先的工作负载,固定序列长度的场景已不再代表真正的服务性能,而是在 InferenceX 套件中降级为“维护模式”。
AgentX 通过交错推理和工具使用来衡量预先录制的 Claude Code 会话的服务性能,从而弥补这一差距。它使用AIPerf 客户端依次回放每个会话。由于每个系统都会接收相同的记录流量,因此观察到的差异反映的是服务堆栈,而不是特定于基准的调优。下面的图 3 展示了预先录制的会议示例。

回放会保留每个会话的上下文和输入/ 输出序列长度,以及在原始轨迹中捕获的推理时间和工具调用延迟。这些间隔保留了原始会话的计时,再现了实际基准测试必须捕获的 KV 缓存容量压力。
AgentX 改变并发性,以在吞吐量和交互性之间进行权衡。在每个操作点,它都会报告每调配兆瓦的持续吞吐量,以及每个堆栈重复使用重复上下文的能力
如何解读 AgentX 结果
对于 AI 工厂来说,最重要的 AgentX 指标是每兆瓦 token 数量。该基准测试根据四个用户体验值报告此指标:端到端标准化交互性、标准交互性、端到端延迟和到达第一个令牌的时间 (TTFT) 。下表 1 介绍了如何充分利用这些资源。
| 指标 | 定义 | 实用性 |
| E2E 标准化交互 | 每个用户在整个请求中的平均输出令牌率,计算方法是将总输出令牌除以从请求提交到最终令牌交付的时间。 | 显示在给定的端到端体验下,平台每兆瓦提供的用户可见输出量,包括获得第一个 token 所需的时间。越高越好。 |
| 标准交互性 | 仅生成期间的每个用户 token 速率,计算方法为输出 token 除以从第一个 token 到最后一个 token 的耗时。 | 显示开始生成后,平台每兆瓦可提供的流式输出量,不包括生成首个 token 所需的时间。越高越好。 |
| E2E 延迟 | 单个请求的总耗时 (从提交到最终输出令牌到达的时间) 。 | 测试每兆瓦的吞吐量结果是否可用:如果请求耗时过长而无法完成,高效率将无济于事。越少越好。 |
| TTFT | 从提交到第一个输出令牌到达的耗时。 | 显示节能高效的吞吐量是否与快速的第一响应相结合,这在智能体反复开始长上下文转换时至关重要。越低越好。 |
NVIDIA Vera Rubin NVL72 结果
以下 Vera Rubin NVL72 结果由 NVIDIA 使用 SemiAnalysis AgentX 工作负载测量得出,目前正在等待 SemiAnalysis 审核。如下图 4 所示,在 AgentX DeepSeek V4-Pro 工作负载上,Vera Rubin NVL72 可为每位用户提供每秒 160 个 token 的性能,与 GB300 NVL72 相比,每兆瓦 AI 工厂吞吐量最高可提升 30 倍,这表明在保持相同交互式服务目标的同时,代理式推理能力显著提升。

如需详细了解 NVIDIA Vera Rubin NVL72 如何提供更高的每兆瓦性能,请参阅 深入了解 NVIDIA Rubin GPU 架构:助力代理式 AI 时代。
NVIDIA GB300 NVL72 结果
在 AgentX 上,对于 AgentX 工作负载上的 DeepSeek V4 Pro 1.6 T,GB300 NVL72 可提供比 H200 NVL8 高 15 倍的每兆瓦 AI – Factory 吞吐量 (参见下方图 5) 。换言之,GB300 NVL72 可在相同的功耗预算内维持更灵敏的代理式推理吞吐量。

这种吞吐量优势直接转化为单位经济效益。GB300 NVL72 可将每百万个 token 的成本降低 10 倍 (下方图 6) 。对于运营商而言,这意味着固定的功率和基础设施预算可以支持更具交互性的代理容量,或者以更低的运营成本提供相同的容量。

随着模型规模的增加,GB300 NVL72 的优势变得更加明显。下图 7 显示了 AgentX 工作负载上 Kimi K3 2.8 T 的每兆瓦吞吐量。GB300 NVL72 的每兆瓦吞吐量约为 H200 NVL8 在同等交互性下的 80 倍,还将交互性前沿扩展到每位用户每秒约 215 个 token,远远超出了 H200 NVL8 的操作范围。

这些 GB300 NVL72 结果反映了服务运行时、模型内核和纵向扩展结构中的系统级工作。这些层结合在一起,使大型 MoE 模型能够在智能体会话累积上下文、并发增加以及解码需求加剧时,保持响应迅速的吞吐量。
- MoE 服务运行时:框架包括SGLang、TensorRT-LLM和vLLM可以在NVL72域中分配专家执行。技术如Wide Expert Parallelism和DeepEP有助于平衡更多GPU上的专家工作,增加并发智能体请求的有效批量大小。
- MoE 内核和通信重叠:基于 DeepGEMM 的内核、MXFP4 和 MXFP8 等混合精度格式以及融合的 MoE 执行路径可减少在专家阶段之间移动数据所花费的时间。通过将专家并行通信与 Tensor Core 计算重叠,服务堆栈可以提高推理和编码工作负载的 token 吞吐量。
- NVIDIA Dynamo: Dynamo 将预填充和解码分离为独立扩展的工作池,允许根据自身的性能要求配置每个阶段。它还支持通过会话 ID 提供会话感知服务,会话 ID 会关联智能体运行中的相关模型调用、工具范围和追踪。另外,其 KV-cache-aware 路由器使用缓存重叠和工作负载来选择目标,从而减少不必要的预填充计算,并帮助维持响应灵敏的多回合服务,作为代理会话重用上下文。
- NVIDIA NVLink 纵向扩展结构:NVLink 在高带宽纵向扩展域中连接 GB300 NVL72 中的 72 个 GPU。这可实现所需的计算、内存、专家并行通信和 KV 缓存移动,从而将大型模型作为协调的机架级系统提供服务。
代理式 AI 的未来发展方向是什么?
Vera Rubin NVL72 展示了当机架级系统针对代理式推理的长上下文、交互式和分布式执行模式进行调整时,可能实现的效果。更广泛的 Vera Rubin 平台将这种方法扩展到整个工作流程。Rubin GPU 可高效处理大型上下文并进行解码,Vera CPU 可处理工具执行和 KV 缓存卸载,而 Groq 3 LPX 可实现超快交互性。
在整个 AI 工厂中,NVLink 6、ConnectX-9、BlueField-4 和 Spectrum-X 可在资源之间移动 token、上下文和工具结果。Dynamo、Attention-FFN Disaggregation、NVFP4、TensorRT-LLM WideEP,以及在最合适的处理器上执行预测解码坐标。目标很简单:减少重新计算和等待,随着智能体会话的增长保持交互性能,并将更多的固定功耗预算转化为有用的智能体输出。
要探索此结果背后的技术和基准,请从以下资源开始。
- 探索 NVIDIA Rubin 的架构和功能
- 在 SemiAnalysis InferenceX 控制面板 上查看实时基准测试结果
- 了解 NVIDIA 的极致协同设计如何在构建日益复杂的智能体系统的过程中,解决代理式系统日益增加的复杂性、延迟和经济性问题。
致谢
这项工作得益于 Xin Li、Ankur Singh、Anthony Casagrande、Jonas Li、Po-Han Huang、Xiaoming Chen 以及其他许多才华横溢的 NVIDIA 工程师的专业知识和工程贡献。