返回行业情报

NVIDIA DSX:从兆瓦到Token的AI工厂效率革命

From Megawatts to Tokens: How NVIDIA Maximizes AI Factory Production

NVIDIA发布DSX平台,通过MaxLPS动态功耗分配和Flex电网协同技术,让AI工厂在固定电力预算下提升Token吞吐量。Lambda实测显示同功耗下Token吞吐提升24%,能效提升23%。Emerald AI在硅谷电力需求响应项目中成功验证了AI工厂作为可调度资源的商业可行性。

深度解读

NVIDIA这篇博客的核心判断是:AI工厂的竞争维度正在从“建设规模”转向“每瓦产出”,而DSX平台是它给出的系统性答案——不是优化单个部件,而是重新设计整个电力到Token的转化链路。

一个八月傍晚的实证:电网信号如何变成Token

故事发生在硅谷一个炎热的八月傍晚,空调负载飙升,Silicon Valley Power(SVP)向一座AI工厂发出削减用电的信号。Emerald AI的Conductor平台接收到信号后,自动执行预设的工作负载层级:低优先级任务让路,高优先级推理继续运行,功率从4兆瓦降到3兆瓦,全程无人操作。Emerald AI CEO Varun Sivaram在Zoom上带着约四十人观看,产品负责人Mansi Shah说“感觉像SpaceX火箭发射”。SVP此后已向该工厂发送超过200次需求信号,每次都成功响应

这个案例的关键意义不在于技术本身,而在于它证明了一件事:AI工厂可以成为电网的“可调度资源”,而不是电网的负担。

为什么这件事比表面看起来重要得多

美国AI工厂面临的最大瓶颈不是GPU供应,而是电力接入。新建输电线路的周期可以长达十年,这意味着如果AI工厂只能作为刚性负载运行,整个行业的扩张速度将被电网基础设施锁死。Emerald AI的Conductor平台接入的是SVP的Flexible Load Interconnect Program——这是第一个将AI工厂视为可调度资源的商业电网项目。当电网紧张时,愿意“柔性运行”的工厂反而获得了更大的运行许可。这个逻辑一旦成立,AI工厂的选址、审批、并网速度都会发生质变。

Lambda的验证数据:24%的Token吞吐量提升意味着什么

同一天在AI Infra Summit上,云服务商Lambda发布了DSX MaxLPS在部署环境中的首次验证结果。Lambda在5个机架、19个节点的集群上运行该软件,发现可以在与16个节点满功率运行相同的电力预算内运行19个节点,集群级Token吞吐量从约400万Token/秒提升到500万Token/秒,提升24%,每瓦性能提升23%。Lambda云服务总裁Dave Ward的原话是:“我们相信已经超越了固定电力预算的限制。”

DSX MaxLPS的工作原理是实时监控GPU和机架级功耗,根据工作负载类型在节点间重新分配余量。训练和推理的功耗曲线不同,当AI工厂同时运行两者时,静态电力分配会留下大量“搁浅容量”。MaxLPS把这些容量回收出来。NVIDIA的预测是,在下一代Vera Rubin NVL72 AI工厂中,DSX MaxLPS在合适部署环境下可释放高达40%的额外GPU容量,且电力预算不变。

24%不是一个小数字。在一个1吉瓦的AI工厂里,这相当于凭空多出240兆瓦的有效算力——而新建240兆瓦的发电和输电设施可能需要数年。

黄仁勋那句话的真正含义

Jensen Huang说过:“一座1吉瓦的工厂永远不会变成2吉瓦的工厂。”这句话的表面意思是物理极限不可突破,但深层含义是:当系统触及物理边界时,工程师的唯一出路是停止优化部件,开始设计整体。DSX就是NVIDIA对这个原则的工程化表达。它横跨网络、冷却、水效和设施设计,但博客重点展示的是电力管理和电网参与两个维度的早期成果。

DSX的产品矩阵:不只是软件

DSX MaxLPS是动态电力分配软件,实时监控GPU和机架级功耗,回收搁浅容量。DSX Flex接收电网信号(减载、需求响应、电价事件),调整AI工作负载优先级,保护高优先级任务的同时降低整体功率。DSX OS是开源模块化软件,用于AI工厂生命周期管理、运行时一致性、健康自动化和弹性。DSX Sim让运营商在物理部署前建模和验证工厂设计。DSX Reference Designs是与生态伙伴共同设计的、按代际验证的架构,覆盖计算、网络、存储和设施。

这套组合的意图很明确:NVIDIA不只想卖GPU,它想定义AI工厂的运行标准。当你的电力分配、电网交互、生命周期管理都跑在DSX上时,NVIDIA就从芯片供应商变成了基础设施操作系统。

800V直流架构:下一层电力交付革命

博客末尾提到了800V DC电力架构。随着AI工厂规模扩大,传统的低压电力路径增加了转换复杂度,限制了配电能力。800V直流架构的设计目标是降低转换复杂度、提高电力交付效率、支持更密集的加速计算机架。这是DSX的下一层——不仅管理电力怎么用,还重新定义电力怎么送。

第一个专用DSX Flex商业部署:弗吉尼亚Manassas

首个专用DSX Flex商业部署将落在弗吉尼亚州Manassas的NVIDIA AI Factory Research Center,是一座96兆瓦的Vera Rubin AI工厂,建立在此前横跨两大洲的五次演示基础之上。Emerald AI的Conductor平台将作为DSX Flex的一部分逐步整合。

这对行业意味着什么

三件事正在同时发生。第一,电力预算从刚性约束变成可优化变量——MaxLPS证明同样的兆瓦可以产出更多Token。第二,AI工厂从电网的被动消费者变成主动参与者——Flex和Conductor证明工厂可以响应电网信号而不中断关键任务。第三,NVIDIA从芯片公司变成AI工厂的操作系统提供商——DSX覆盖了从设计仿真到运行管理到电网交互的全链路。

对于从业者而言,最直接的启示是:每瓦Token数正在成为AI基础设施的核心KPI。如果你的电力策略还是静态分配、刚性运行,你已经在浪费20%到40%的潜在算力。而对于整个行业,SVP那200多次成功响应的信号说明了一件事——AI工厂与电网的关系正在被重新定义,而定义规则的人,目前看是NVIDIA。

行业动态NVIDIAAI工厂能效优化数据中心电网协同