返回行业情报

NVIDIA AI工厂投资回报三大支柱

Productive, Durable, Fungible: How NVIDIA AI Factories Maximize Return on Investment

NVIDIA提出AI工厂最大化投资回报的三大要素:产能(每兆瓦吞吐量与每token成本)、耐久性(GPU多年持续盈利,A100服役六年仍有价值)和通用性(支持各类AI及非AI负载,CUDA跨代兼容)。通过全栈协同设计,Vera Rubin NVL72相比GB300 NVL72每兆瓦吞吐量提升超30倍,每百万token成本降低达45倍。

深度解读

AI工厂的回报率取决于三个变量——每兆瓦产能、硬件有效寿命、以及需求广度——而英伟达正试图用“高产出、长耐用、强通用”这三重工程叙事,把每一座价值6000万美元/兆瓦的资本赌注锁定在自己的平台上。

为什么是这三个变量

英伟达这篇博客的核心逻辑并不复杂,但它值得逐层拆开。一座AI工厂的投资回报率由三个因子决定:产出能力(如果卖光所有能生产的token,一年能赚多少)、有效寿命(硬件能持续赚钱多久)、需求(这些token到底有多少人买)。三者不能互相补偿——产出能力再高,如果只能卖掉一部分产能,回报依然难看;需求再旺,如果一年后硬件就跑到满负荷极限,回报同样崩塌。英伟达的论证是:这三个变量并不独立,能跑更多种类工作负载的工厂,自然能找到更多需求,从而年复一年地保持盈利。

能跑更多种类工作负载的工厂,自然能找到更多需求,从而年复一年地保持盈利。

产出能力:每兆瓦token数与每token成本

电力是AI工厂的硬约束。在这个约束下,每兆瓦每秒token数成为决定产出能力的核心指标。固定功率包络内产出更多token,意味着更多收入;每token成本更低,意味着更高利润率。

英伟达在这里给出了具体数据:根据SemiAnalysis AgentX的数据,NVIDIA Vera Rubin NVL72系统在DeepSeek V4 Pro模型上,每兆瓦吞吐量比NVIDIA GB300 NVL72高出30倍以上,每百万token成本低至45分之一。这种量级的提升来自全栈协同设计——从模型和工作负载,向下穿透软件、计算、网络和内存,全部一起优化。博客还引用了SemiAnalysis AgentX对GB300 NVL72运行GLM 5.3的性能分析作为佐证。

这里有一个反直觉的追问:如果每一代都把token成本大幅压低,计算需求会萎缩吗?英伟达的答案是:不会,反而会扩张。更便宜的token让更多用例变得经济可行,而这些新用例消耗的token总量,超过效率提升所节省的部分。这是典型的杰文斯悖论在AI算力领域的翻版。

耐用性:存量硬件持续赚钱

如果每一代都远超前一代,老一代硬件怎么办?英伟达的答案是:不是所有工作负载都需要最新系统。合适的匹配取决于工作负载的复杂度和形态,这就是为什么上一代硬件在下一代到来后仍在赚钱。

具体证据链:NVIDIA A100 GPU于2020年出货,六年后仍在商业服务中运行。CoreWeave最近将2020年首次推出的设备预订延长到了2029年。多年来,每家主要运营商都延长了服务器的折旧年限——这本质上是对“硬件何时停止赚钱”的猜测,而这个猜测一直在往后移。

Sprout在2026年9月发布的《The Productive Life of a Data Center GPU》追踪了各大运营商折旧时间表的变化。几个关键数据点:微软的NVIDIA V100集群实际运行了8.4年,而账面折旧年限是六年;Barkr根据二手转售价格估算,八卡H100系统的有效寿命为五到六年,GB300 NVL72为九到十年;Silicon Data显示,六年前的A100 GPU仍值原价的四分之一,而按五年折旧表它在一年多前就已经归零;Ornn Data发现,市场为A100 GPU的五年期租约支付的租金,是一个月期租约的80%。

会计寿命是对物理寿命的保守代理——而物理寿命一直在超出会计寿命。

CUDA作为英伟达GPU的编程软件平台,跨代运行,所以新架构到来时,运营商已有的东西不会被搁浅。持续的软件和内核优化不断提升现有硬件的性能。同一平台运行机器学习、深度学习、生成式AI、推理、代理式AI和物理AI——每一种新工作类型都落在了已经安装的硬件上。这就是通用性。

通用性:每种AI、每个阶段、每个地点

为单一类型工作负载建造的工厂,是在赌这种工作负载会持续存在。能运行一切的工厂,即使工作负载变化,也依然有用、依然产生收入。

英伟达AI工厂运行每一种AI模型——开源和专有——覆盖语言、视觉、生物、物理和机器人。它们运行每个阶段,从数据处理到预训练、后训练和推理。它们运行在每个地点,从超大规模和AI云到主权项目、企业数据中心和边缘。

但并非所有工作都是构建和运行AI模型。同一套基础设施还运行数据处理、科学计算、仿真、图形等。所有这些工作负载,无论是否AI,都归结为并行数学,而英伟达GPU正是为在数千个核心上同时运行这种数学而建造的。CUDA是为什么一颗芯片能模拟光线、折叠蛋白质、预测下一个token。超过1000个现成的CUDA-X库覆盖从深度神经网络、计算光刻、量子电路仿真到向量搜索和气候建模的一切,超过1000万开发者在其上构建。这就是英伟达GPU是通用加速计算而非为单一工作负载定制的ASIC的原因。

通用不等于平庸:Tensor Cores和Transformer Engine把AI优化的硬件放进可编程架构,在一颗芯片里同时提供专用性和灵活性。一套架构运行所有工作,是保持高利用率和回报的关键。

生产环境中的通用性证据

这种通用性在客户生产环境中得到了验证。礼来在1016块GPU的本地集群上构建和运行蛋白质、小分子和基因组模型,同时为自己的团队运行聊天机器人和代理式工作流。Pinterest在超大规模云上后训练和部署视觉语言模型,横跨14000块GPU,覆盖NVIDIA Blackwell、Hopper和更早架构。Revolut用NVIDIA cuDF处理数十亿笔交易记录的数据,然后在AI云上训练和部署基础模型。Runway在NVIDIA Hopper上训练世界模型,在NVIDIA Blackwell平台上通过云基础设施提供服务。德克萨斯A&M大学在其超级计算机上运行分子模拟和AI药物发现,在26个项目和7个机构中达到95-98%的利用率。

所以呢

英伟达这篇博客本质上是一份投资回报率论证,目标读者是那些准备签下每兆瓦6000万美元资本承诺的AI工厂运营商。它的核心主张是:英伟达平台通过全栈协同设计实现最高每兆瓦吞吐量和最低每token成本,通过CUDA跨代兼容和持续软件优化延长硬件有效寿命,通过通用加速计算架构覆盖所有AI类型、所有阶段、所有地点以及大量非AI工作负载,从而在三个维度上同时最大化回报。

对行业从业者而言,这意味着几件事。第一,折旧年限的持续延长正在改变AI基础设施的财务模型——如果A100六年后的残值仍有四分之一,如果H100的五年期租约租金是月租的80%,那么把GPU当作三年或五年归零的资产来核算,可能严重低估了其经济寿命。第二,通用性正在成为对抗技术迭代风险的策略——当工作负载类型变化时,专用ASIC可能搁浅,而通用GPU可以转向。第三,每兆瓦token数作为核心运营指标的地位正在确立,它同时决定了收入和成本两端。

对趋势而言,英伟达正在把“买GPU”重新定义为“建AI工厂”,把采购决策从芯片性能比较提升到投资回报率建模。这是一种叙事升级:它不再只卖算力,而是卖一套关于资本效率、资产寿命和需求覆盖的完整财务论证。至于这套论证是否在每个具体场景下都成立,取决于运营商的实际利用率、电力成本、以及他们能签下什么样的客户合同——但英伟达已经把框架搭好了,剩下的就是运营商自己算账。

其
行业动态NVIDIAAI工厂投资回报GPUCUDA