NVIDIA Groq 3 LPX 是适用于 NVIDIA Vera Rubin 平台 的交互式 AI 推理加速器。该平台的核心是 NVIDIA Vera Rubin NVL72,这是迄今为止功能超强的机器,可为各种 AI 工作负载 (从小型到大型模型,开放和封闭) 提供高吞吐量和交互性。Groq 3 LPX 与 Vera Rubin NVL72 搭配使用时,可扩展该平台的能力,使其能够处理交互性最高的服务层,从而扩展 Vera Rubin 作为 AI 工厂 一部分的用户体验。
在本文中,我们将介绍 Groq 3 LPX 系统的首个第三方性能基准测试:Artificial Analysis 在 Groq 3 LPX 上的 Gemma 4 31B 模型上运行了其 10 万个上下文基准测试,测量了每秒 3431 个输出token的世界级交互性。驱动这种性能的技术解锁了 Vera Rubin 平台的能力,通过将 Groq 3 LPX 与 Vera Rubin NVL72 搭配使用,为由 2T+ 参数模型驱动的多代理系统提供高交互性和长上下文支持。
为什么高交互性的长上下文很重要?
代理式会话的特点是多圈推理。在每次回合结束时,智能体的输出附加到不断增长的上下文中,并将其输入到所有后续回合中。

如图 1 所示,整个智能体会话中的上下文可能会增长到数十万个 token,尤其是当会话次数超过数百次时。这意味着,在任务的后期,智能体必须反复处理迄今为止所学的所有内容。
如果没有长上下文,智能体只能考虑之前相关上下文的一小部分。无论底层模型有多快或多智能,有限的上下文都意味着有限的代理能力。能力最强的智能体不仅必须提供速度,而且还必须随着会话的增长保留较长的上下文。
为何为具有超快交互性和长上下文的模型提供服务具有挑战性?
以每位用户每秒 3000 多个 token 的速度为模型提供服务,同时管理 10 万个输入 token 的 KV 缓存,这带来了独特的系统挑战。在推理系统中,张量并行 (TP) 等分割和征服技术可以实现数量级的加速,前提是系统能够高效地管理所需的协调 (集合运算) 。但最高级别的交互性需要非常小的批量大小,而固定的协调成本可能会超过 TP 节省的时间。
TP 涉及两个部分:在多个芯片上并行拆分执行一系列计算,然后组合结果。在高交互性推理所需的极小批量下,要使 TP 有效,就需要紧密协调。许多小张量必须在计算单元之间传输,使每个张量准确地在需要的位置和时间离开和到达。传达和组合结果所花费的时间很容易就能与分配计算所节省的时间相美,甚至更多。

在任何系统上,处理器间网络都必须协调这一系列传输。如图 2 所示,每次传输所需的总时间由两个部分组成:
- 第一位延迟:用于确定应使用哪条特定通信链路进行传输、同步发送者和接收者链路端点以及仲裁冲突 (例如两个芯片希望同时通过单个链路发送数据) 所花费的时间。
- 传输时间:通过网络移动数据的实际时间,这是相对于网络带宽传输的数据量的函数。
TP 能够提供数量级的加速,需要将第一比特延迟降低到绝对最小。在整个前向传递中这样做 (为模型权重和长上下文 KV 缓存采用并行性) 需要一种同时考虑到低延迟和长上下文的方法。
Groq 3 LPX 如何为具有超快速交互性和长上下文的模型提供服务?
NVIDIA Groq 3 LPX 利用其编译器调度工作负载规划,为具有长上下文的超快交互性模型提供服务。这包括其芯片到芯片 (C2C) 机架内网络,以及与处理器间通信大量重叠计算的能力。
紧密调度的芯片间通信
Groq 3 LPX 使用确定性执行模型。这意味着编译器可以查看:
- 256 个 LP30 本地处理单元 (LPU) 中的每个计算单元
- 这些芯片中总计 128 GB 的基于 SRAM 的内存
- 每个芯片的 96 个 C2C 链路的运行速度为 112 Gbps
它可以使用这些信息生成一个时间表,在工作负载开始之前全天候准确地运行。
这具有许多优势。与高交互性最相关的是,它消除了传输的实时仲裁需求,因为它可以计划每个数据在每个 C2C 链路上的移动时间,从而在工作负载开始之前生成如图 3 所示的数据传输时间表。

此外,这种预工作负载调度能够从根本上改变数据传输的发生方式。许多系统的每次传输都有几个步骤,即使对于小数据块也是如此:
- 一个芯片可能会请求传输数据
- 另一个芯片可能会确认数据可用于传输和定位
- 这些数据可能会与同时传输的其他数据产生冲突
相比之下,编译器生成的调度意味着 LPU 可以在准备就绪时发送时钟周期数据,并在到达时使用时钟周期数据,如图 4 所示。

这些链路是一对 LPU 之间的点对点链路,每个 LPU 可以充当路由器和处理器,这意味着如果需要,数据可以通过其他 LPU 路由到 LPU。
这种网络设计可让 LPX 将图 2 中的第一比特延迟降低到绝对最小值。在批量较大的情况下,与通过线缆实际发送字节的时间相比,第一个比特延迟时间相形见;但对于 paroto 的高交互性区域,最小化固定传输初始化时间至关重要。
细粒度计算 – 通信重叠
LPX 编译器除了预先安排小批量推理所需的许多小型 C2C 传输之外,还可以非常精细的粒度将这些传输与计算重叠。
计算和通信的重叠对于从任何推理系统中获得出色性能至关重要。LPX 可以更进一步:编译器以 320 字节向量级别调度其计算和通信单元上的工作负载。如图 5 所示,矩阵乘法可表示为一系列点积,利用这一事实,编译器可以调度单个 LPU 来计算输出矩阵的 320 列,并在计算完成后立即通过 C2C 链路发送这些列。

这使得 Groq 3 LPX 能够在结果足以填充 320 字节向量时立即开始数据传输,而无需等待整个矩阵运算完成。这增加了计算和通信的重叠,这对于小张量尤其重要 (图 6) 。

在长上下文推理中计算量最大的注意力运算中,这些技术共同实现了数量级的加速。通过实现芯片间计算和通信的紧密协调调度,Groq 3 LPX 可以利用张量并行的 divide-and-conquer 方法,即使在 Pareto 的小批量、高交互性部分也能实现加速。
Groq 3 LPX 在人工分析基准测试中实现了 10 万环境下的领先交互性
Artificial Analysis 具有标准的基准测试套件,用于在不同推理提供商的模型上测试这些提供商的服务速度 (输入上下文长度为 1 万和 10 万) 。借助此套件,Artificial Analysis 在其 10 万项基准测试中对 Gemma 4 ( 2026 年 4 月发布的 31B 参数密集型模型) 进行了基准测试。NVIDIA Groq 3 LPX 系统在自己的数据中心以每秒 3431 个输出 token 的速度生成答案 (图 7) 。

在输入上下文长度为 10 万(100K)token 的样本中,中位速度为 3,431 token/秒。所有模型和提供商均使用了相同的“o200K_basetokens”分词器(tokenizer)。
通过在整个机架中对 SRAM 进行低延迟访问,我们期望能够在数十万个 token 中保持这种速度。对于智能体编码任务,智能体可以轻松读取超过 10 万个上下文token的数百个文件,并在生成 5000 个生成的推理和输出token时整合该上下文,这不仅是上下文用户将从中受益,而且速度也将从根本上改变他们的体验。按照这个速度,5000 个 token 的解码大约需要 1.5 秒,而 50 秒的解码速度是每秒 100 个 token。即使是这种比较也很慷慨,因为当今最热门的代理式工具每秒运行近 60 个 token。

Artificial Analysis 还在 1 万上下文长度下对同一系统进行了基准测试,以检查 LPX 在该长度下能否实现类似的性能;他们发现 Groq 3 LPX 的响应速度为每秒 3382 个输出token。LPU 确定性架构和高张量并行性相结合,可将延迟和输出 token/ 秒 (相对于上下文长度) 的变化降至最低。

输入上下文长度为 1 万的样本的平均速度为 3382 个token/ 秒。使用了相同的“o200K_basetokens”分词器。
Artificial Analysis 和 NVIDIA 的测试证实,针对这两个基准测试的 NVIDIA 配置在其输出中没有损失精度或模型质量。详细了解人工分析测试方法。
作为特定于编码的补充衡量标准,我们运行了开源SPEED-Bench基准测试,因为原始生成速度在代理式编码工作流中尤为重要。NVIDIA Groq 3 LPX 系统使用相同的 Gemma 4 模型,以每秒 4767 个输出 token 的中值速度和每秒 5520 个输出 token 的 P80 生成这些编码问题的答案。这意味着,此数据集上 20% 的任务以每秒超过 5500 个token的速度完成。

输出 token 的速度中值为 4767 个 token/s;超过 20% 的问题以超过 5500 个 token/s 的速度生成解决方案。
NVIDIA Groq 3 LPX 如何与 Vera Rubin NVL72 一起加速长上下文代理式 AI 工作负载?
Groq 3 LPX 的这种新的低延迟、确定性执行能力与 Vera Rubin NVL72 机架相结合,可实现多种服务配置,包括:
- 标准预填充 – 解码分解:Vera Rubin NVL72 每次可处理预填充并释放 KV 缓存一次。Groq 3 LPX 使用此 KV 缓存以及 SRAM 中的权重来执行整个解码步骤。
- 注意力 – FFN 分解:Vera Rubin NVL72 计算注意力并在 DRAM 中保存 KV 缓存,而 Groq 3 LPX 则执行 FFN 层。每个全注意力层仅在机架之间发送一次中间token。
- 外部起草人预测解码:Groq 3 LPX 在 Vera Rubin NVL72 上的大型目标模型之前运行一个小型草稿模型,该模型会验证和提交 token,并返回下一个数据块的拒绝位置。每个机架都保留自己模型的 KV 缓存,并且在链路中仅保留 draft token。
所有这些都使每个机架能够专注于其最适合执行的工作负载部分。借助这一完全协同设计的解决方案,LPX 能够将 Vera Rubin 平台的高交互性和低延迟提升到新的水平。图 11 显示了扩展后的 GPT-OSS 模型在 Vera Rubin NVL72 和 Groq 3 LPX 上运行至 2 万亿个参数的投影。

了解详情
NVIDIA Groq 3 LPX 速度现已通过第三方基准测试进行测量,证实其在上下文长度下提供领先的交互性,这对于代理式工作负载至关重要。NVIDIA 还在编码任务的开源基准测试中测量了更极致的性能。
如需详细了解Groq 3 LPX,请参阅深入了解 NVIDIA Groq 3 LPX:适用于 NVIDIA Vera Rubin 平台的低延迟推理加速器。