NVIDIA Groq 3 LPX 是面向 NVIDIA Vera Rubin 平台 的交互式 AI 推理加速器。该平台的核心是 NVIDIA Vera Rubin NVL72,这是有史以来用途最广泛的机器,可在最广泛的 AI 工作负载范围内提供高吞吐量与交互性——从小型模型到大型模型,涵盖开源与闭源。Groq 3 LPX 与 Vera Rubin NVL72 搭配使用时,可扩展该平台应对最高交互性服务层级的能力,从而拓展 Vera Rubin 作为 AI 工厂 一部分为用户体验提供支持的能力。
在本文中,我们报告 Groq 3 LPX 系统上的首个第三方性能基准测试:Artificial Analysis 在 Groq 3 LPX 上对 Gemma 4 31B 模型运行了其 100K 上下文基准测试,测得世界级的交互性,达到 3,431 输出 token/秒。实现这一性能的技术,通过将 Groq 3 LPX 与 Vera Rubin NVL72 搭配,释放了 Vera Rubin 平台以高交互性和长上下文为 2T+ 参数模型驱动的多智能体系统提供服务的能力。
为什么高交互性下的长上下文很重要?
智能体会话的特点是多轮推理。在每一轮结束时,智能体的输出会被追加到不断增长的上下文中,并输入到所有后续轮次。

图 1. 在多轮智能体会话中,带入每一轮的上下文稳步上升 如图 1 所示,在整个智能体会话中,上下文可以增长到数十万 token,尤其是当会话超过数百轮时。这意味着,在任务后期,智能体必须反复处理它到目前为止学到的所有内容。
如果没有长上下文,智能体只能考虑此前相关内容的一小部分。无论底层模型有多快或多聪明,有限的上下文都意味着有限的智能体能力。能力最强的智能体不仅必须提供速度;它们还必须在会话增长时保留长上下文的同时做到这一点。
为什么以超快交互性和长上下文为模型提供服务具有挑战性?
以每用户每秒超过 3,000 token 的速度为模型提供服务,同时为 100K 输入 token 管理 KV 缓存,会带来独特的系统挑战。在推理系统中,诸如张量并行(TP)之类的分而治之技术可以带来数量级的加速——前提是系统能够高效管理所需的协调(集合操作)。但最高水平的交互性需要非常小的批大小,此时固定的协调成本可能超过 TP 节省的时间。
TP 涉及两个部分:将一系列计算并行拆分到多个芯片上执行,然后合并结果。在高交互性推理所需的极小批量规模下,要使 TP 有效,就需要紧密的协调。许多小张量必须在计算单元之间传输,每个张量都要在恰好需要的时间和地点离开和到达。用于通信和合并结果的时间很容易变得与分布式计算所节省的时间相当——甚至更多。

图 2. 在任何系统中,在两个芯片或核心之间传输数据所需时间的公式。使用张量并行进行小批量推理的瓶颈通常是首位延迟(A),因为发送的数据量(N)相对于可用网络带宽(B)来说非常小在任何系统上,处理器间网络都必须协调这一系列传输。如图 2 所示,每次单独传输所花费的总时间有两个组成部分:
首位延迟:确定应使用哪条特定通信链路进行传输、同步发送方和接收方链路端点以及仲裁冲突(例如两个芯片希望同时通过一条链路发送数据)所花费的时间。传输时间:数据在网络中实际移动的时间,它是所传输数据量相对于网络带宽的函数。
TP 所能提供的数量级加速要求将首位延迟降至绝对最低。在整个前向传递过程中——对模型权重和长上下文 KV 缓存都采用并行——要做到这一点,需要一种在设计时就同时考虑低延迟和长上下文的方法。
Groq 3 LPX 如何以超快交互性和长上下文服务模型?
NVIDIA Groq 3 LPX 利用其编译器调度的工作负载规划,以超快交互性和长上下文服务模型。这包括其机架内芯片到芯片(C2C)网络,以及将计算与处理器间通信大量重叠的能力。
紧密调度的芯片间通信
Groq 3 LPX 使用确定性执行模型。这意味着编译器可以了解:
- 256 个 LP30 本地处理单元(LPU)中每个单元内的各个计算单元
- 这些芯片中总共 128 GB 的基于 SRAM 的内存
- 每个芯片 96 条 C2C 链路,每条运行速度为 112 Gbps
它可以使用这些信息生成一个调度,精确到时钟周期地规定工作负载在开始之前将如何运行。
这有许多优点。与高交互性最相关的是,它消除了对传输进行实时仲裁的需要,因为它可以在工作负载开始之前规划每块数据何时通过每条 C2C 链路移动,从而生成如图 3 所示的数据传输调度。

图 3. Groq 3 LPX 编译器在工作负载运行之前生成的 C2C 传输示意性调度,正如智慧城市中行人、骑行者和汽车无需实时互相让行即可最优通行
此外,这种工作负载前的调度使数据传输方式发生了根本性转变。许多系统对每次传输都有多个步骤,即使对于小块数据也是如此:
- 一个芯片可能发出传输数据的请求
- 另一个芯片可能确认数据可传输并定位它
- 数据可能必须与同时传输的其他数据争用
相比之下,编译器生成的调度意味着 LPU 可以在数据就绪的时钟周期发送数据,并在数据到达的时钟周期消费数据,如图 4 所示。

*图 4.*LPU 调度路由实现少量步骤和低争用,降低首比特链路是 LPU 对之间的点对点连接,每个 LPU 既可以作为处理器,也可以作为路由器,这意味着如果需要,数据可以通过其他 LPU 路由到目标 LPU。
这种网络设计让 LPX 将图 2 中的首比特延迟降至绝对最低。在大批量下,这一首比特延迟时间与实际通过线路发送字节的时间相比微不足道;但在帕累托曲线的高交互性区域,最小化固定的传输初始化时间变得至关重要。
细粒度计算-通信重叠
LPX 编译器除了预调度小批量推理所需的许多小型 C2C 传输外,还能以非常细的粒度将这些传输与计算重叠。
重叠计算与通信对于从任何推理系统中获得最优性能都至关重要。LPX 可以更进一步:编译器以 320 字节向量的粒度在其计算和通信单元上调度工作负载。利用矩阵乘法可以表示为一系列点积这一事实(如图 5 所示),编译器可以调度各个 LPU 计算输出矩阵的 320 列,并在计算完成后立即通过 C2C 链路发送。

图 5. Groq 3 LPX 利用矩阵乘法是一系列点积这一事实,在切片就绪后立即开始发送结果这使 Groq 3 LPX 能够在足以填满 320 字节向量的结果就绪后立即开始传输数据,而不是等待整个矩阵运算完成。这增加了计算与通信的重叠,这在小型张量下尤为重要(图 6)。

图 6. Groq 3 LPX 的细粒度 C2C 调度使计算能够在通信尾部最小的情况下完成这些技术共同实现了长上下文推理中计算最密集的注意力操作的成数量级加速。通过实现芯片间计算与通信紧密协调的调度,Groq 3 LPX 能够利用张量并行的分而治之方法,即使在帕累托前沿中小批量、高交互性的部分也能提供加速。
Groq 3 LPX 在 Artificial Analysis 基准测试中于 100K 上下文下实现领先的交互性
Artificial Analysis 拥有标准基准测试套件,用于在 10K 和 100K 输入上下文长度下测试不同推理提供商在其模型上的服务速度。使用该套件,Artificial Analysis 在其 100K 基准测试中对 Gemma 4(一款于 2026 年 4 月发布的 31B 参数稠密模型)进行了基准测试。NVIDIA 在其自有数据中心部署的一套 NVIDIA Groq 3 LPX 系统生成了每秒 3,431 个输出 token 的答案(图 7)。

图 7. 由 Artificial Analysis 测量的 Groq 3 LPX 在 Gemma 4 上、100K 输入 token 上下文长度时的速度在 100K 输入上下文长度的样本中,速度中位数为每秒 3,431 个 token。使用了“o200K_basetokens”分词器——在所有模型和提供商中保持一致。
凭借对机架内 SRAM 的低延迟访问,我们预计能够将这一速度维持到数十万 token 的规模。对于智能体编码任务,智能体可能轻松读取数百个文件,轻易超过 100K 上下文 token,并在生成 5,000 个推理和输出 token 时纳入该上下文,这不仅让用户从上下文中受益,而且这种速度从根本上改变了他们的体验。按此速度,解码 5,000 个 token 大约需要 1.5 秒,而在每秒 100 个 token 的速度下则需要 50 秒。即便这样的比较也还是宽容的,因为当今最流行的智能体工具运行速度更接近每秒 60 个 token。

图 8. 模型以每秒 100 个 token 的速度提供服务时生成 5,000 个 token 所需的时间,对比 Groq 3 LPX 在 100K 上下文长度下实测的速度Artificial Analysis 还在 10K 上下文长度下对同一系统进行了基准测试,以检验 LPX 在该长度下能否达到类似性能;他们发现 Groq 3 LPX 的应答速度中位数为每秒 3,382 个输出 token。LPU 的确定性架构与高张量并行度相结合,使得延迟和每秒输出 token 数随上下文长度的变化极小。

图 9. Artificial Analysis 测得的 Groq 3 LPX 在 Gemma 4 上、10K 输入 token 上下文长度下的速度在 10K 输入上下文长度下,各样本的速度中位数为每秒 3,382 个 token。使用的是同一个“o200K_basetokens”分词器。
Artificial Analysis 和 NVIDIA 的测试证实,这两项基准测试中 NVIDIA 的配置在输出上均无精度或模型质量损失。了解有关 Artificial Analysis 测试方法的更多信息。
作为一项补充性的编码专项测量,我们运行了开源的 SPEED-Bench 基准测试,因为原始生成速度在智能体编码工作流中尤为重要。使用相同的 Gemma 4 模型,NVIDIA Groq 3 LPX 系统对这些编码问题的应答速度中位数为每秒 4,767 个输出 token,P80 为每秒 5,520 个输出 token。这意味着该数据集上 20% 的任务以每秒超过 5,500 个 token 的速度完成。

图 10. 在 SPEED-Bench 编码问题上测得的 Groq 3 LPX 在 Gemma 4 上的速度输出 token 速度中位数为每秒 4,767 个 token;超过 20% 的问题其解答生成速度超过每秒 5,500 个 token。
NVIDIA Groq 3 LPX 如何与 Vera Rubin NVL72 一起加速长上下文智能体 AI 工作负载?
将 Groq 3 LPX 这种全新的低延迟、确定性执行能力与 Vera Rubin NVL72 机架搭配,可实现多种服务配置,包括:
标准预填充-解码分离:Vera Rubin NVL72 处理预填充,并在每轮交接一次 KV 缓存。Groq 3 LPX 使用该 KV 缓存以及保存在 SRAM 中的权重,执行整个解码步骤。注意力-FFN 分离:Vera Rubin NVL72 计算注意力并将 KV 缓存保存在 DRAM 中,而 Groq 3 LPX 执行 FFN 层。机架之间仅传递中间 token,每个完整注意力层传递一次。外部草稿模型投机解码:Groq 3 LPX 在 Vera Rubin NVL72 上的大型目标模型之前运行一个小型草稿模型,后者验证并提交 token,并返回被拒绝的位置以供下一块使用。每个机架保留各自模型的 KV 缓存,只有草稿 token 跨链路传输。
所有这些都使每个机架能够专注于其最擅长执行的那部分工作负载。借助这一完全协同设计的解决方案,LPX 能够将 Vera Rubin 平台推向高交互性与低延迟的新高度。图 11 展示了在 Vera Rubin NVL72 和 Groq 3 LPX 上运行的、扩展至 2 万亿参数的 GPT-OSS 模型的预测结果。

图 11. Groq 3 LPX 扩展了 Vera Rubin 平台的能力,使其能够支持具有高交互性的代理式 AI 工作负载
*GPT-OSS 2T 是 GPT-OSS 120B 模型的扩展版本。
了解更多
NVIDIA Groq 3 LPX 的速度现已由第三方基准测试测量,证实其在对于代理式工作负载至关重要的上下文长度下可提供领先的交互性。NVIDIA 还在一个开源编码任务基准上测量到了更为极端的性能。
要了解有关 Groq 3 LPX 的更多信息,请参阅 Inside NVIDIA Groq 3 LPX: The Low-Latency Inference Accelerator for the NVIDIA Vera Rubin Platform。
