返回行业情报

NVIDIA发布Vera Rubin与DSX平台,提升AI工厂能效

AI Infra Summit: NVIDIA Vera Rubin and DSX Platform Advancements Showcase Energy Efficiencies of Optimizing Tokens Per Watt for AI Factories

NVIDIA在AI Infra Summit上展示Vera Rubin NVL72和DSX平台,通过全栈优化实现每兆瓦更高token吞吐。MLPerf v6.1中Vera Rubin吞吐达GB300的3.7倍;DSX MaxLPS让Lambda每瓦性能提升23%,同功率预算下token吞吐增24%;Emerald AI与硅谷电力演示灵活负载计划,使AI工厂成为可调度的电网资源。

深度解读

AI基础设施的竞争焦点已从单纯的峰值算力转向“每兆瓦能产出多少token”,NVIDIA在AI Infra Summit上联合Amazon、d-Matrix、Emerald AI、Lambda、Pinterest等伙伴展示的Vera Rubin与DSX平台进展,正是对这一新范式的系统性回应。

从“算力竞赛”到“token/瓦特”的指标迁移

NVIDIA超大规模与高性能计算副总裁Ian Buck在Santa Clara Convention Center的演讲中明确了一个判断:AI工厂的衡量标准正在快速从峰值性能转向“经验证的智能体token每兆瓦”。这意味着行业的价值锚点发生了根本位移——过去比拼的是单卡FP16算力或集群规模,现在比拼的是在固定电力预算下能稳定产出多少可用的推理token。

“基础设施必须是可替换的、可靠的、能持续10年,真正成为计算全球各行业问题的资产——他们可以用Vera Rubin、DSX和我们这里的所有创新来构建。”

Buck的这段话点出了AI工厂的资产属性。与消费级GPU不同,AI工厂是十年期的重资产投资,电力合同、冷却系统、网络拓扑一旦落地就难以更改。因此“每兆瓦token数”不仅是一个性能指标,更是一个财务指标——它直接决定了单位token的折旧成本和运营利润。

Vera Rubin NVL72:3.7倍吞吐背后的MLPerf信号

MLPerf Inference v6.1的结果是本次发布中最硬核的数据点。NVIDIA Vera Rubin NVL72在首次预览提交中,吞吐量达到GB300 NVL72的3.7倍。这个数字需要放在上下文中理解:GB300 NVL72本身已经是当前量产的最强推理系统之一,3.7倍的代际跃升意味着Vera Rubin架构在NVLink带宽、HBM容量与带宽、以及Dynamo推理软件栈的协同优化上取得了实质性突破。

更值得关注的是GB300 NVL72的扩展效率数据:一个跨四机架、288 GPU的提交实现了99%的扩展效率,吞吐量从单机架基线近乎线性增长。99%这个数字在分布式推理中极为罕见——通常网络延迟、同步开销和负载不均衡会吞噬掉5%到15%的扩展效率。NVIDIA能做到99%,说明Spectrum-X EthernetConnectX SuperNICs在数千节点互联时的拥塞控制和自适应路由已经相当成熟。

软件层面的贡献同样不可忽视。NVIDIA在v6.1的提交中,仅通过软件优化就比v6.0提升了1.6倍性能,且提交期结束后还有额外增益。这意味着企业客户即使不更换硬件,仅升级DynamoNeMo库就能获得显著的推理经济学改善。对于已经部署Blackwell的客户而言,这是一个零资本支出的性能提升路径。

DSX MaxLPS:Lambda实测23%能效提升的工程含义

Lambda的验证结果是DSX MaxLPS的第一个公开商业部署数据。Lambda在相同的电力预算内运行了19个节点,而传统静态供电只能支撑16个满功率节点。集群级token吞吐从约400万token/秒提升到500万token/秒,增幅24%,每瓦性能提升23%

这个结果的核心机制在于动态功率分配。传统AI集群按峰值功耗为每个机架预留电力,但训练和推理的功率曲线截然不同:训练通常在计算密集阶段拉满功耗,推理则在等待KV cache或网络I/O时出现功率低谷。MaxLPS持续监控GPU和机架的实时功耗,将空闲功率重新分配给正在满载运行的节点,从而在同一个兆瓦预算内塞进更多有效计算。

对于下一代Vera Rubin NVL72,NVIDIA声称DSX MaxLPS在合适的部署环境中可带来最多40%的额外GPU容量。40%这个数字如果能在真实负载中兑现,意味着AI工厂的资本效率将发生质变——同样的电力基础设施和建筑空间,可以支撑多出近一半的GPU,单位token的固定成本摊销将大幅下降。

Emerald AI与Silicon Valley Power:AI工厂作为电网柔性资源

Emerald AI与NVIDIA合作、在Silicon Valley Power的柔性负载互联计划下完成的演示,指向了一个更宏观的命题:AI工厂能否成为电网的调节器而非单纯的负担。

演示系统成功响应了Silicon Valley Power发出的数百个需求信号,在保护关键AI工作负载性能的前提下自动降低负载。DSX Flex接收电网信号——包括减载请求、需求响应事件和电价信号——并根据预定义的工作负载层级自动执行:最关键的任务继续运行,其余任务暂停后恢复。

这一能力使AI工厂能够作为柔性电网资源运行,在电网需要缓解时降低需求,保护优先AI工作负载,并证明可控的AI负载可以帮助释放更多电网容量用于增长。

这对行业的意义在于破解一个日益尖锐的矛盾:AI数据中心的电力需求正在与居民用电和工业用电争夺有限的电网容量,许多地区的并网排队时间已经长达数年。如果AI工厂能证明自己是“可中断、可调节”的柔性负载,而非“必须无条件保障”的刚性负载,那么电网运营商将更愿意为其释放容量。Emerald AI计划将DSX Flex集成到其Conductor电网响应式电源管理软件中,这暗示着一个新的商业模式正在成形:AI工厂不仅产出token,还可以通过参与需求响应获得电网补偿,进一步改善项目经济性。

d-Matrix与NVLink Fusion:异构推理的开放化

d-Matrix将Raptor XPU与NVIDIA Vera CPU通过NVLink Fusion集成的合作,值得单独审视。NVLink Fusion是NVIDIA向第三方芯片开放其高速互联协议的战略举措,允许非NVIDIA的XPU以原生NVLink带宽接入NVIDIA的CPU和GPU集群。

d-Matrix的Raptor XPU专注于超低延迟推理,其架构针对内存内计算稀疏推理做了专门优化。与Vera CPU通过NVLink Fusion结合后,系统可以在同一互联域内同时运行NVIDIA GPU上的大模型推理和d-Matrix XPU上的低延迟小模型推理,而无需经过PCIe或以太网的多跳转发。这对于智能体AI场景尤为关键——一个智能体工作流可能需要在不同阶段调用不同规模的模型,延迟敏感的决策步骤交给Raptor,吞吐密集的生成步骤交给Rubin,两者通过NVLink Fusion共享统一内存地址空间。

Amazon Annapurna Labs与NVIDIA在NVHBM定制高带宽内存上的合作则指向另一个方向:定制化内存。NVHBM意味着超大规模客户可以根据自身工作负载特征定制HBM的容量、带宽和功耗配比,而非接受通用规格。这反映了AI基础设施正在从“通用GPU”向“工作负载定义硬件”演进。

所以呢:AI工厂的竞争壁垒正在从芯片转向系统与电网

把以上所有信息串起来,一个清晰的判断浮出水面:AI基础设施的竞争维度已经从一个点扩展到一个面。单颗芯片的算力领先只能维持一个季度,但从硅到电网的协同设计——包括芯片、互联、推理软件、功率管理、电网接口——构成的系统壁垒需要数年才能复制。

Pinterest使用Blackwell和Dynamo将对话式AI引入视觉发现,Lambda用MaxLPS在相同电力下多跑24%的token,Emerald AI让AI工厂响应电网信号——这些案例的共同点是,客户购买的已经不是GPU,而是一个每兆瓦token产出率可验证、可优化、可参与电网互动的完整系统。

对于从业者而言,这意味着三件事。第一,评估AI基础设施时,token/瓦特token/美元应该取代峰值FLOPS成为首要指标。第二,软件优化——Dynamo、NeMo、MaxLPS、DSX Flex——带来的性能提升已经可以与硬件代际升级相提并论,软件团队的投入产出比正在急剧上升。第三,AI工厂的选址和电力策略将和芯片选型同等重要,能够参与需求响应、获得柔性并网许可的项目将在长期运营成本上占据结构性优势。

NVIDIA在AI Infra Summit上展示的不是某一款芯片的胜利,而是一个从Vera Rubin NVL72DSX MaxLPS再到DSX Flex的垂直整合栈。这个栈的每一层都在回答同一个问题:如何让每一瓦特电力产出更多有价值的token。当行业还在争论AGI的时间表时,NVIDIA已经把赌注押在了更务实的地方——不管模型多大、智能体多复杂,电力始终是硬约束,而约束条件就是最大的商业机会。

AI前沿NVIDIAAI基础设施能效优化Vera RubinDSX平台