返回行业情报

NVIDIA Vera Rubin NVL72树立AI代理效率新标杆

Up to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Standard for AI Agents

NVIDIA公布Vera Rubin NVL72新实测数据,在代理式AI工作负载下,其每兆瓦吞吐量较GB300 NVL72提升高达30倍,每百万token成本降低35倍。该平台通过解耦式服务、大规模专家并行、分布式KV缓存等软硬件协同设计,满足代理式AI长上下文与高token消耗需求,为AI工厂提供更高能效与盈利能力。

深度解读

NVIDIA用一份基于真实代理编码轨迹的实测数据,宣告其下一代AI工厂平台Vera Rubin NVL72在代理式AI工作负载上的能效比达到现有旗舰GB300 NVL72的30倍,每百万token成本降低35倍,这标志着AI基础设施的竞争焦点已从单纯的算力峰值转向“单位功耗下的代理任务吞吐量”。

这份由NVIDIA产品经理Shruti Koparkar于2026年8月24日发布的博文,核心数据来自SemiAnalysis AgentX工作负载——该负载并非合成测试,而是记录了真实的代理式编码会话,保留了上下文增长、工具调用和子代理生成的全过程。NVIDIA声称,在DeepSeek V4 Pro模型上,GB300 NVL72本身已比Hopper架构(即H100时代)能效高15倍,而Vera Rubin在此基础上再翻一倍,达到30倍。这组数字的惊人之处在于,它不是在静态的聊天基准上测得的,而是在上下文长度可达数十万token、输入输出长度剧烈波动的代理工作流中取得的。

为什么代理式AI是“吞token巨兽”,而旧架构力不从心

要理解这30倍的意义,必须先看清代理式AI与传统LLM推理的根本差异。根据博文引用的OpenRouter数据,代理式AI工作负载消耗的token是简单聊天请求的15倍。以博文中的投资研究代理为例:它查询金融数据库、搜索新闻和文件、调用子代理进行同行比较和估值建模,最后综合成建议——每一步推理产生的token都成为下一步的输入,上下文像滚雪球一样膨胀,最终可能达到数十万token的输入长度。

传统推理基准(如聊天或文档摘要)的输入输出序列通常只有1K到8K token,这种短上下文场景下,GPU的预填充(prefill)解码(decode) 阶段可以高度流水线化。但代理式AI的上下文累积效应彻底改变了计算特征:长上下文处理成为核心瓶颈,且请求间的输入输出长度极不均衡。这意味着,衡量性能的标准必须从“单次推理请求的延迟”进化为“完整代理工作流的吞吐量”。NVIDIA此次发布的数据,正是首次用这种“全工作流”视角来量化新一代平台的效率。

30倍能效提升从何而来:不止是芯片,是“极端协同设计”

Vera Rubin NVL72的能效飞跃并非单一芯片的功劳,而是NVIDIA宣称的“极端协同设计”(Extreme Codesign) 在七个芯片、软件栈和网络互连层面的系统性胜利。博文列举了多项关键优化技术,每一项都直击代理式AI的痛点:

分离式服务(Disaggregated Serving) 将上下文处理(prefill)与响应生成(decode)拆分为独立阶段,各自独立扩展,并引入速率匹配(Rate Matching) 同步两阶段的生产速度。这解决了代理长上下文场景下prefill和decode计算量严重不均的问题。大规模专家并行(Large-scale Expert Parallelism) 将混合专家模型中的专家子网络分布在整个scale-up GPU域中,而分布式KV缓存(Distributed KV-caching) 将内存扩展到整个域,并将不活跃的上下文分层卸载到主机和存储——这直接回应了代理会话中“上下文不断累积、需要反复访问”的痛点,避免了重复计算。KV感知路由(KV-aware Routing) 更是将请求精准导向已持有相关缓存的GPU,减少长会话中的冗余计算。

在底层硬件上,Rubin GPU的第五代Tensor Core第三代Transformer Engine加速了推理的prefill和decode两个阶段,NVFP4量化将模型权重压缩至4位精度,在降低内存占用和提升吞吐的同时不牺牲输出质量。而这一切的基石,是NVL72的scale-up GPU域——这一架构从Grace Blackwell延续至Vera Rubin,通过第六代NVLink和NVLink Switch实现高带宽、低延迟的GPU间通信,其数据包速率比以太网替代方案高10倍,延迟低3倍。博文特别强调,完整的Vera Rubin平台是七芯片架构,包括Vera CPU、Groq 3 LPU(语言处理单元)、NVLink 6 Switch、BlueField-4 DPU、Spectrum-6 SPX和ConnectX-9 SuperNIC,全部为AI工厂规模化部署代理而定制。

所以呢:对AI工厂而言,每瓦特吞吐量就是收入,每百万token成本就是利润

这组数据对行业最直接的含义,在于它重新定义了AI工厂的经济模型。博文直言:“对于受电力约束的AI工厂,每瓦特吞吐量决定了AI工厂的收入,每百万token成本决定了该收入的利润率。” 在电力供应成为AI扩张最大瓶颈的现实中,Vera Rubin NVL72让运营商在相同的能耗预算下完成30倍的代理工作量,或者反过来说,完成同样的工作量只需原来1/30的电力——这意味着新建数据中心可以大幅缩减对电网的依赖,而存量数据中心则能在不扩容的情况下将代理服务规模扩大一个数量级。

NVIDIA的DSX MaxLPS技术在此扮演了关键角色,它在GPU、机架和工作负载三个层面管理功耗,在相同的兆瓦预算内可多配置40%的GPU。这解释了为什么NVIDIA敢于承诺35倍更低的token成本——成本下降不仅来自芯片本身的效率,还来自系统级功耗管理带来的更高GPU密度。对于正在将代理式AI投入生产的企业(软件开发、客户服务、深度研究等),这意味着同样的预算可以支撑更长的代理会话、更复杂的工具调用链,或者服务更多并发用户。

竞争格局的突变信号:NVIDIA的“加速创新节奏”与生态护城河

这份数据发布的时间点(2026年8月)和语境值得玩味。博文开篇即称“这些早期结果展示了NVIDIA加速的创新节奏”,并强调“随着持续软件优化,Vera Rubin NVL72和GB300 NVL72的性能都将继续提升”——这是典型的NVIDIA式话术,既展示新平台的领先,又安抚现有GB300客户其投资不会贬值。但更深层的信号是,NVIDIA正在用实测数据而非纸面规格来建立竞争壁垒。SemiAnalysis AgentX工作负载的引入,意味着行业基准测试的标准正在从静态benchmark转向动态代理工作流,而NVIDIA不仅主导了硬件,还深度参与了基准的定义。

博文中提到的“Vera Rubin已全面投产,正在生态系统中扩展”以及同期发布的“Groq 3 LPX全面投产”新闻(Groq的LPU是NVIDIA七芯片架构中的推理加速组件),揭示了NVIDIA的另一个战略:通过将第三方芯片(如Groq LPU)纳入自家AI工厂参考架构,来巩固其在代理式AI基础设施中的“总承包商”地位。这不再是单纯的GPU销售,而是整个计算堆栈的交付——从GPU、CPU、DPU、交换机到软件栈(TensorRT LLM、Dynamo服务框架)和能耗管理系统。

对从业者的实际启示:不要只看倍数,要看工作负载匹配度

对于AI工程师和基础设施规划者,这组数据提供了一个关键视角:性能提升的幅度高度依赖工作负载特征。30倍的数字是在SemiAnalysis AgentX编码轨迹上测得的,该负载的特点是长上下文、频繁工具调用、子代理生成——如果你的应用场景是短查询、低并发的聊天机器人,实际收益可能远低于30倍。博文也承认“这些早期结果尚未反映Vera CPU在工具调用方面的性能”,而工具调用恰恰是代理式AI的核心环节——这意味着真实世界的代理性能可能还有变数。

另一个值得关注的细节是,NVIDIA明确提到“GB300 NVL72在DeepSeek V4 Pro模型上比Hopper架构能效高15倍”——这暗示即便不升级到Vera Rubin,现有Blackwell平台的客户也能通过软件优化获得显著提升。NVIDIA正在用这一代际数据说服客户:升级的紧迫性不在于跑不动,而在于单位经济性——在代理式AI大规模商用的竞赛中,谁能将token成本降到对手的1/35,谁就能以更低的价格提供更长的推理深度,从而在应用层建立无法逾越的成本优势。

软件定义的效率:CUDA内核与运行时优化的杠杆效应

博文在技术细节中埋藏了一个常被忽视但至关重要的点:融合CUDA内核(如MegaMoE) 将大量计算和GPU间通信操作合并为单次执行,减少GPU等待数据的时间。这揭示了一个事实——在硬件架构确定后,软件栈(优化后的CUDA内核、TensorRT LLM推理运行时、Dynamo服务框架)的持续优化能带来“多倍性能提升”。NVIDIA特意强调“Vera Rubin NVL72和GB300 NVL72的性能都将随着软件优化持续提升”,这既是给现有客户的定心丸,也是向竞争对手(如AMD、自研芯片的云厂商)施压:即便你能在芯片规格上追赶,NVIDIA在CUDA生态和推理软件栈上的积累,使其每一代硬件都能在生命周期内通过软件更新不断释放额外性能。

对于云服务商和大型企业AI平台,这意味着采购决策不应只看芯片峰值算力,更要看软件栈的成熟度和持续优化能力。NVIDIA的“协同设计”将硬件、系统软件、运行时和网络捆绑成一个不可分割的整体,任何试图只替换其中一环(例如只用NVIDIA GPU而自研网络或软件)的做法,都可能无法复现NVIDIA官方宣称的端到端效率。

代理式AI的“iPhone时刻”与基础设施军备竞赛

将这份数据放在更大的背景下,它标志着AI基础设施竞赛进入了一个新阶段:从“训练更大的模型”转向“高效运行代理工作流”。OpenRouter的数据显示代理工作负载的token消耗是聊天的15倍,这意味着随着代理式AI从演示走向生产,token消耗量将呈指数级增长。NVIDIA押注的正是这一点——当每个企业都部署数十个代理处理从软件开发到投资研究的任务时,token生成成本将成为决定AI应用商业可行性的核心变量。

Vera Rubin NVL72的30倍能效提升,本质上是在告诉市场:代理式AI的规模化瓶颈不是模型能力,而是基础设施的经济性。如果每百万token成本能降低35倍,那么原本因成本过高而无法落地的长时运行代理(例如持续监控市场并自动交易的金融代理、全天候处理客服工单的服务代理)将变得可行。这可能会引发一轮新的应用创新浪潮——正如移动互联网时代流量资费下降催生了视频和社交应用一样。

但也要警惕NVIDIA的营销策略。这组数据由NVIDIA自己测量,且博文注明“目前待SemiAnalysis审查”——这意味着独立验证尚未完成。30倍的数字是否包含选择性基准(例如只测了最有利的模型和上下文长度区间),尚需第三方复现。不过,即便真实数字打五折,15倍的能效提升依然足以颠覆现有AI工厂的规划逻辑。对于任何正在建设或规划AI基础设施的机构,这份报告传递的信号是明确的:电力效率将成为代理式AI时代的核心竞争力,而NVIDIA正试图用Vera Rubin平台锁定下一代数据中心的标准架构

AI前沿NVIDIAAI代理推理效率