返回行业情报

NVIDIA Vera Rubin推理平台扩展,Groq 3 LPX加速智能体AI

With Groq 3 LPX in Full Production, NVIDIA Extends Vera Rubin Inference for Agents

NVIDIA宣布Vera Rubin NVL72平台扩展,推出Groq 3 LPX推理加速器,实现每秒3400 token输出,比竞品快4倍。通过极致协同设计整合计算、网络与推理加速,SpaceXAI、CoreWeave、Nebius等伙伴已采用。该架构专为智能体AI的长上下文和多系统协作场景优化,构建高效"token工厂"。

深度解读

NVIDIA在2026年8月24日抛出的这颗重磅炸弹,核心判断只有一个:AI推理的胜负手已经从“单芯片算力”彻底转移到“全栈系统协同”,而他们用来定义这个新时代的答案,就是名为Vera Rubin NVL72的机架级系统,以及为其量身定制的NVIDIA Groq 3 LPX推理加速器。

从训练到推理:AI工厂的范式转移

文章开篇就点明了一个行业转折点:AI的重心正在从“训练”转向“推理”和“智能体”。这意味着什么?意味着过去我们关注的是用多少天训练出一个大模型,而现在和未来,我们关注的是这个模型在服务用户时,每秒能吐出多少个Token,以及每个Token的边际成本是多少。智能体(Agentic)AI是这一转变的核心驱动力,它们不再是简单的问答机器,而是会自主规划、调用工具、与其他AI系统协作、处理超长上下文的复杂执行体。这种工作负载对基础设施提出了截然不同的要求——不是单次计算的峰值性能,而是持续吞吐、极低延迟和极端规模下的经济性

性能数字背后的真实含义

NVIDIA给出的基准测试数据极具冲击力:在Artificial Analysis的测试中,运行开源智能体模型Gemma 4 31B,面对10万Token长上下文场景时,NVIDIA Groq 3 LPX实现了每秒3400个输出Token,速度是“最接近的替代平台”的4倍。这个数字不是用来炫技的。10万Token的长上下文是智能体处理复杂任务(如分析整本代码库、阅读长篇法律文件)的典型场景,而3400 Token/秒意味着用户几乎感觉不到AI在“思考”的停顿,体验从“等待响应”变成了“实时对话”。4倍的性能差距,直接转化为Token成本的急剧下降,这才是NVIDIA真正要卖的东西——不是芯片,而是“更便宜的智能”。

## 极简协同设计:GPU与LPU的联合作战

NVIDIA这次的技术路线图非常清晰,他们称之为“极简协同设计(Extreme Codesign)”。这里的核心创新在于,NVIDIA Rubin GPU不再单打独斗。在Vera Rubin NVL72平台中,Rubin GPU负责处理大规模上下文计算(Context Processing),而NVIDIA Groq 3 LPX(基于LPU架构)则专门负责延迟敏感的解码(Decode)任务。这是一种明确的分工:GPU是“思考的大脑”,LPU是“说话的快嘴”。传统架构中,速度和吞吐量是鱼与熊掌,而NVIDIA声称这种组合设计“消除了速度与吞吐量之间的传统权衡”。更关键的是,这种协同不是简单的板卡级拼接,而是系统级、网络级、甚至机架级的深度整合,例如一个机架级Groq 3 LPX部署可以包含256个LP30加速器,通过直接芯片间互连组成一个巨型推理引擎。

## 网络层:被忽视的“隐形冠军”

如果只看GPU和LPU,会忽略NVIDIA布局的另一半——Spectrum-X Multiplane网络。这恰恰是“AI工厂”概念的精髓。文章提到,CoreWeave已经将Spectrum-X Multiplane投入生产,用于连接Vera Rubin机架。这个网络的核心价值在于利用多个并行交换机构建一个高带宽、扁平、无损的AI网络。为什么这至关重要?因为在多智能体协作和长上下文推理中,数据流不再是简单的“客户端到服务器”,而是GPU到GPU、机架到机架之间海量的、持续的、低延迟的数据搬运。如果网络是瓶颈,再快的GPU和LPU也只能空转等待数据。NVIDIA将网络层纳入协同设计,意味着他们试图定义AI工厂的“神经系统”,而不仅仅是“大脑皮层”。

## 商业落地:谁在买单,为什么买单

NVIDIA的发布会从不缺合作伙伴站台,但这次的点位很值得玩味。SpaceXAI宣布其下一代智能体AI将采用NVIDIA Vera CPU,这是一个极具象征意义的合作——从地球数据中心到轨道卫星,AI的边界被拓展到了太空。而SpaceXAI强调的Vera CPU优势在于编排(Orchestration)、工具调用、代码执行、数据处理等CPU密集型任务,这恰恰是智能体工作流中除了神经网络计算之外最耗时的部分。Nebius则成为“第一个采用NVIDIA Groq 3 LPX的AI云”,它计划将其整合进“Token工厂”。CoreWeave则聚焦于网络层。这三家代表了三种不同的AI基础设施服务商形态,他们的共同选择验证了NVIDIA全栈方案的吸引力——要么加入NVIDIA的生态体系,要么在Token成本竞赛中落后

## 对行业和从业者的终极拷问

这篇文章对AI从业者意味着什么?首先,“单卡跑模型”的时代彻底终结了。未来的竞争力取决于你是否能租用或构建一个经过“极简协同设计”的AI工厂,而不是你手里有几张H100。其次,“Token成本”将成为AI应用的生死线。当NVIDIA宣称通过协同设计能大幅降低单位Token成本时,那些依赖高昂推理成本来维持竞争力的中间层应用,将面临被碾压的风险。最后,智能体的体验标准被重新定义。3400 Token/秒的输出速度,让“实时交互式AI”从口号变成了可测量的工程指标。对于开发者而言,这意味着你的应用设计逻辑要适应一个“AI响应几乎零延迟”的世界。NVIDIA没有在文章里给出更多未来路线图,但“这仅仅是开始”这句话,暗示着这套系统还有更多性能压榨空间——而这,对于所有依赖AI算力的玩家来说,既是福音,也是新一轮资本开支的军备竞赛信号。

AI前沿NVIDIAAI推理智能体Vera RubinGroq LPX