AI芯片推理加速器
NVIDIA Groq 3 LPX是专为NVIDIA Vera Rubin平台设计的交互式AI推理加速器。该平台的核心是NVIDIA Vera Rubin NVL72——迄今为止最通用的AI计算机器,能够在从小型到大型、开源到闭源的各类AI工作负载中提供高吞吐量与强交互性。Groq 3 LPX与Vera Rubin NVL72协同工作,专门面向对交互性要求最高的推理场景,作为AI工厂的重要组成部分,进一步拓展了Vera Rubin平台驱动用户体验的能力。
本文报告了Groq 3 LPX系统的首个第三方基准测试结果:Artificial Analysis在Groq 3 LPX上针对Gemma 4 31B模型运行了10万Token上下文基准测试,测得输出速度高达每秒3,431个Token,达到世界级交互性水平。这些性能背后的技术支撑,使得Vera Rubin平台能够以高交互性和长上下文服务由2万亿以上参数模型驱动的多智能体系统。
智能体工作负载为何需要长上下文
智能体会话的特点是多轮推理。每轮结束后,智能体的输出会被追加到持续增长的上下文中,并输入到所有后续轮次中。
如图1所示,随着会话超过数百轮,整个智能体会话的上下文可增长至数十万Token。这意味着在任务后期,智能体必须反复处理此前积累的所有信息。
若缺乏长上下文能力,智能体只能处理此前相关信息的一小部分。无论底层模型的速度多快、能力多强,有限的上下文意味着有限的智能体能力。最强大的智能体不仅要提供速度,还必须在会话不断增长的过程中保持对长上下文的处理能力。
张量并行中的协同挑战
在每用户每秒超过3,000个Token的速度下同时管理10万Token输入的KV缓存,对系统架构提出了独特挑战。在推理系统中,张量并行(TP)等分治技术能够带来数量级的加速——前提是系统能够高效管理所需的协调开销(集合通信操作)。然而,最高级别的交互性需要极小的批量大小,此时固定的协调成本可能抵消TP所节省的时间。
TP包含两个部分:将一系列计算分配到多块芯片上并行执行,然后合并结果。在高交互性推理所需的极小批量规模下,让TP有效运作需要极为紧密的协调。大量小型张量必须在计算单元之间传输,每个张量必须在精确的时间抵达精确的位置。通信和结果合并所花费的时间,可能轻易赶上甚至超过分布式计算所节省的时间。
任何系统中的处理器间网络都必须协调这一系列传输。如图2所示,每次单独传输的总耗时由两部分构成:
首字节延迟:确定应使用哪条通信链路、同步发送端与接收端链路端点,以及仲裁冲突(例如两块芯片同时尝试通过同一链路发送数据)所花费的时间。
传输时间:通过网络实际移动数据的时间,是数据量与网络带宽的函数。
TP所能提供的数量级加速,需要将首字节延迟降至绝对最低。在整个前向传播过程中——对模型权重和长上下文KV缓存均采用并行——需要一种兼顾低延迟与长上下文的设计方案。
编译器调度:消除协调开销的关键
NVIDIA Groq 3 LPX通过编译器调度的工作负载规划,实现了超快交互性与长上下文的兼顾。这包括芯片间(C2C)机架内网络,以及将计算与处理器间通信高度重叠的能力。
Groq 3 LPX采用确定性执行模型,编译器对以下内容具有完整可见性:
256个LP30本地处理单元(LPU)中的各个计算单元;
这些芯片共计128 GB的总SRAM内存;
每颗芯片96条C2C链路,每条运行速率为112 Gbps。
编译器利用这些信息,能够在工作负载启动之前,精确到时钟周期地生成整个执行计划。
这带来了诸多优势。与高交互性最直接相关的是:由于编译器可以提前规划每份数据在每条C2C链路上的移动时机,因此无需对传输进行实时仲裁,并在工作负载启动前生成如图3所示的数据传输计划。
此外,这种预调度机制从根本上改变了数据传输的方式。许多系统对每次传输都有多个步骤,即使对于小块数据也不例外:一块芯片发出传输请求;另一块芯片确认数据可传输并定位数据;数据可能与其他同时传输的数据产生竞争。
相比之下,编译器生成的调度方案使得LPU可以在数据就绪的时钟周期直接发送数据,并在数据到达的时钟周期直接消费数据,如图4所示。
链路在LPU对之间点对点连接,每个LPU既可作为处理器也可作为路由器,这意味着数据可以经由其他LPU中转路由至目标LPU。
这种网络设计使LPX能够将图2中的首字节延迟降至绝对最低。对于大批量,这一首字节延迟被实际传输字节的时间所淹没;但在追求高交互性的帕累托最优区域,最小化固定传输初始化时间变得至关重要。
细粒度计算与通信重叠
LPX编译器除了对小批量推理所需的大量小型C2C传输进行预调度外,还能以极细的粒度将这些传输与计算重叠执行。
计算与通信的重叠对于任何推理系统达到最优性能都至关重要。LPX更进一步:编译器以320字节向量为粒度调度计算和通信单元上的工作负载。利用矩阵乘法可以表示为一系列点积运算这一特性(如图5所示),编译器可以调度各个LPU计算输出矩阵的320列,并在计算完成后立即通过C2C链路发送。
这使得Groq 3 LPX能够在足够填满一个320字节向量的结果就绪后立即开始传输,而无需等待整个矩阵运算完成。这进一步提高了计算与通信的重叠程度,对小型张量尤为重要(图6)。
这些技术共同作用,使长上下文推理中计算密度最高的注意力操作获得数量级的加速。通过支持芯片间计算与通信的紧密协调调度,Groq 3 LPX能够利用张量并行的分治优势,即使在小批量、高交互性的帕累托最优区域也能提供显著加速。
第三方基准测试结果
Artificial Analysis拥有标准化基准测试套件,用于在10K和100K输入上下文长度下测试不同推理提供商的服务速度。利用该套件,Artificial Analysis对2026年4月发布的310亿参数稠密模型Gemma 4进行了100K基准测试。NVIDIA在自有数据中心部署的Groq 3 LPX系统生成答案的速度达到每秒3,431个Token(图7)。
测试中位速度为每秒3,431个Token,输入上下文长度为10万Token,使用"o200K_basetokens"分词器,所有模型和提供商均采用相同分词器。
由于机架内SRAM的低延迟访问,我们预计该速度可维持至数十万Token的上下文长度。对于智能体编程任务而言,智能体可能读取数百个文件,上下文轻松超过10万Token,并在生成5,000个推理和输出Token时融合这些上下文——用户不仅能受益于如此大的上下文窗口,更能体验到从根本上改变体验的速度。以这一速度解码5,000个Token仅需约1.5秒,而在每秒100个Token的速度下则需要50秒。即便如此比较也已相当保守,因为当前最流行的智能体工具运行速度更接近每秒60个Token。
Artificial Analysis还在10K上下文长度下对同一系统进行了测试,以验证LPX在该长度下能否实现类似性能;测试发现Groq 3 LPX的中位输出速度为每秒3,382个Token。LPU确定性架构与高张量并行度的结合,使延迟和输出Token速度随上下文长度的变化极小。
10K上下文长度测试中位速度为每秒3,382个Token,同样使用"o200K_basetokens"分词器。
NVIDIA和Artificial Analysis的测试均确认,上述两项基准测试的NVIDIA配置在输出精度和模型质量上均无损失。
作为专项编程性能的补充测量,我们在相同Gemma 4模型上运行了开源SPEED-Bench基准测试,因为原始生成速度对智能体编程工作流尤为重要。NVIDIA Groq 3 LPX系统回答编程问题的中位速度为每秒4,767个Token,P80达到每秒5,520个Token。这意味着该数据集上20%的任务以超过每秒5,500个Token的速度完成。
中位输出Token速度为每秒4,767个Token;超过20%的问题解答生成速度超过每秒5,500个Token。
与Vera Rubin NVL72的协同配置
将Groq 3 LPX的低延迟确定性执行能力与Vera Rubin NVL72机架配合,可支持多种服务配置,包括:
标准预填充-解码分离:Vera Rubin NVL72负责预填充,并在每轮结束后将KV缓存移交一次。Groq 3 LPX利用该KV缓存以及存储在SRAM中的权重,执行完整的解码步骤。
注意力-前馈网络分离:Vera Rubin NVL72计算注意力并将KV缓存保存在DRAM中,而Groq 3 LPX执行前馈网络层。机架之间每完整注意力层仅传输中间Token一次。
外部起草器推测解码:Groq 3 LPX在Vera Rubin NVL72上的大型目标模型前运行小型起草模型,目标模型负责验证并提交Token,并返回下一块的拒绝位置。每个机架各自保存其模型的KV缓存,仅起草Token跨链路传输。
所有这些配置均使每个机架专注于其最擅长执行的工作负载部分。通过这一完整的协同设计方案,LPX能够将Vera Rubin平台推向新的高交互性与低延迟水平。图11展示了将开源GPT模型扩展至2万亿参数,在Vera Rubin NVL72和Groq 3 LPX上运行的性能预测。
总结
NVIDIA Groq 3 LPX的速度已经过第三方基准测试验证,确认其在对智能体工作负载至关重要的上下文长度下能够提供领先的交互性。NVIDIA还在编程任务的开源基准测试中测得了更为极致的性能表现。
如需进一步了解Groq 3 LPX,欢迎参阅《NVIDIA Groq 3 LPX内部解析:NVIDIA Vera Rubin平台的低延迟推理加速器》。
Q&A
Q1:NVIDIA Groq 3 LPX在100K Token上下文长度下的实测性能如何?
A:根据第三方机构Artificial Analysis的基准测试,NVIDIA Groq 3 LPX在Gemma 4 31B模型、10万Token输入上下文长度下,中位输出速度达到每秒3,431个Token。在10K上下文长度下,中位速度同样高达每秒3,382个Token,两者差异极小,体现了该系统在不同上下文长度下延迟高度稳定的特性。
Q2:Groq 3 LPX是如何实现低延迟张量并行推理的?
A:Groq 3 LPX采用确定性执行模型,编译器在工作负载启动前即可规划所有芯片间数据传输的精确时序,消除了实时仲裁开销,将首字节延迟降至最低。同时,编译器以320字节向量为粒度将计算与通信高度重叠,使数据一旦就绪即可立即传输,无需等待整个矩阵运算完成,从而在小批量、高交互性推理场景下实现高效的张量并行。
Q3:Groq 3 LPX与Vera Rubin NVL72搭配使用时有哪些部署方式?
A:两者搭配支持三种主要配置:一是标准预填充-解码分离,NVL72负责预填充后将KV缓存交给LPX执行解码;二是注意力-前馈网络分离,NVL72计算注意力并保存KV缓存,LPX执行前馈网络层,机架间仅传输中间Token;三是外部起草器推测解码,LPX运行小型起草模型,NVL72负责验证,两者各保存自身模型的KV缓存,仅起草Token跨链路传输。