Groq 3 LPX
英伟达推出的交互式AI推理加速机架系统,于2026年8月24日正式量产发布,专为Agent场景下的超低延迟推理设计
Groq 3 LPX是英伟达推出的交互式AI推理加速机架系统,于2026年8月24日正式量产发布,专为Agent场景下的超低延迟推理设计。该产品是英伟达Vera Rubin平台的核心扩展组件,通过与Vera Rubin NVL72协同工作,大幅提升AI推理过程中的Token生成速度,为需要多步骤推理的Agent系统提供极速响应体验。
从硬件规格看,每个Groq 3 LPX机架集成256颗LP30(LPU)芯片,每颗芯片配备500MB片上SRAM,片上SRAM总容量达128GB,对应40PB/s的SRAM带宽。每颗LP30芯片还提供96条112Gbps C2C链路,系统可扩展合计384GB DRAM内存作为后援支持。全机架采用液冷设计,基于NVIDIA MGX基础设施构建,32个1U计算托盘每个容纳8颗LP30芯片。
在性能表现上,Groq 3 LPX运行Artificial Analysis基准测试时,在Gemma 4 31B开源Agent模型(100K Token上下文)上创下了3400输出Token/秒的世界纪录。相比最接近的竞品平台,Groq 3 LPX为Agent和延迟敏感型工作负载提供4倍以上的交互响应速度提升,将编码类Agent任务完成时间从数小时压缩至分钟级。在Vera Rubin平台上,LPX使每兆瓦推理吞吐量提升高达35倍,为万亿参数模型带来多达10倍的营收机会。
商业模式上,Groq 3 LPX由NVIDIA设计并量产,Groq云服务(GroqCloud)以及Nebius AI云是首批接入该系统的合作伙伴。Dell Technologies提供基础设施集成与全球供应链支持。企业用户可通过GroqCloud API直接调用Groq 3 LPX推理算力,无需迁移至新的技术栈。
适用场景:需要极速Token生成的大语言模型推理服务、编码Agent、实时多步骤推理Agent系统、百万Token超长上下文应用、以及大规模AI云服务提供商。
评论与建议
登录 后参与评论或提建议