返回行业情报

NVIDIA与CoreWeave联手推进智能体AI生产落地

From Training to Production, NVIDIA and CoreWeave Close the Loop on Agentic AI

NVIDIA与CoreWeave深化合作,将Vera Rubin NVL72系统及首款AI智能体专用CPU Vera投入生产。Cognition成为首个客户,其Devin模型在Vera Rubin上实现4.8倍token吞吐提升。CoreWeave Forge平台统一训练与评估闭环,Vera CPU在智能体沙箱启动上提速超3倍,推动智能体AI从训练到生产全流程加速。

深度解读

NVIDIA与CoreWeave在2026年9月30日宣布将Vera Rubin NVL72系统及Vera CPU正式投入生产环境,首个客户是Devin的开发商Cognition,这标志着Agentic AI从训练到生产的闭环首次在单一云平台上被打通。

为什么这件事值得认真对待

这不是一次普通的硬件发布。CoreWeave是一家从以太坊矿工转型而来的AI云厂商,它与NVIDIA的合作已近十年,从V100时代一直跑到今天。NVIDIA超大规模与高性能计算副总裁Ian Buck的原话是:

"CoreWeave's NVIDIA V100 GPUs are still running customer workloads nearly a decade after Volta launched, even as CoreWeave brings Vera Rubin NVL72 into production."

这句话的信息量在于:它试图证明NVIDIA平台的跨代兼容性不是营销话术,而是有近十年生产验证的事实。对任何正在规划三到五年AI基础设施预算的企业来说,这意味着押注NVIDIA生态的沉没成本风险在降低——旧GPU不会被新框架抛弃,新GPU能无缝接入既有调度体系。这对CoreWeave自身的商业模式更关键:它靠GPU租赁赚钱,如果硬件两三年就报废,经济模型根本不成立。Ian Buck的表态本质上是在替CoreWeave的资产折旧曲线背书。

Vera Rubin NVL72的性能数字到底意味着什么

Cognition在拿到首批Vera Rubin NVL72生产机架后,用FrontierCode采样任务构建了一个真实软件工程推理负载,对比基线是GB200 NVL72。结果是:SWE-2推理工作负载的总token吞吐量提升最高4.8倍。

这个数字需要拆开看。它不是训练吞吐,不是理论峰值,而是推理场景下、真实Agentic Coding任务、端到端token产出的提升。Agentic Coding的特点是长上下文、高并发、多步推理——每一步都要调用模型,每一步的输出都成为下一步的输入。在这种场景下,4.8倍吞吐意味着两件事:

第一,单位token成本直接下降。Cognition创始团队成员Silas Alberti的原话是"cost per token decides what we can ship"——每token成本决定了他们能交付什么产品。这不是技术指标,是产品路线图的约束条件。

第二,实时响应能力质变。Devin作为AI软件工程师,需要在人类开发者的工作流中实时生成代码、执行多步推理。4.8倍吞吐意味着同样的硬件预算下,可以支撑更多并发用户,或者让单个用户的等待时间大幅缩短。

但要注意:这是"early tests",是Cognition自己跑的benchmark,不是第三方审计结果。4.8倍这个数字的参考价值在于方向性,不在于精确性。

Vera CPU:被低估的另一半

大多数人关注GPU,但这次发布中Vera CPU的角色可能同样关键。Agentic AI对基础设施的压力来自两个方向:推理侧需要低延迟大规模计算,后训练侧需要同时运行数千个隔离环境。

CoreWeave的Vera部署方案是:单机架128颗CPU、11,264个核心,足以支撑超过11,000个并发隔离环境(每个环境一个核心)。配合Spectrum-X以太网交换机和BlueField-4 DPU,这些环境在硬件层面隔离,同时与训练任务并行运行。

测试数据:Vera CPU上Agent沙箱启动时间快3倍以上,在Terminal-Bench上所有通过任务的性能提升1.7倍。

"所以呢"——Agentic AI的瓶颈正在从"模型够不够聪明"转向"能不能同时跑足够多的Agent实例"。RL训练需要大量并行环境来采集经验,Agent工具调用需要隔离沙箱来保证安全,模型评估需要可复现的执行环境。这些都不是GPU能解决的,是CPU密集型任务。Vera CPU的定位就是吃掉这块负载,让GPU专注于推理和训练。

CoreWeave Forge:闭环的真正含义

这次发布中最具战略意义的产品是CoreWeave Forge。它要解决的问题是:模型和Agent的改进依赖一个循环——生产行为反馈到下一轮训练,每次评估优化下一个版本——但这个循环历史上分散在不同厂商的工具链中,每次交接都会丢失信号。

Forge把Weights & Biases、OpenPipe的后训练能力、开源marimo notebook整合到一个环境中,且保持对模型、框架、云的开放性。具体能力包括:

CoreWeave ARIA(已GA):分析运行结果、提出实验建议、推荐代码修改并存入GitHub、带回可操作的证据。

CoreWeave Agent Lens(新服务):将生产Agent可观测性转化为持续改进,失败检测提升20%,修复成本降低一半,把数千万条生产Agent trace转化为改进洞察。

CoreWeave Sandboxes(已GA):在隔离的CPU或GPU环境中运行Agent、工具调用、RL和评估,支持serverless或既有训练基础设施。

Serverless RL:比自管理方案训练快1.4倍,成本低40%。

NVIDIA Dynamo驱动的RL Rollouts(私有预览):在不重新部署的情况下将新checkpoint加载到运行中的部署里,让RL持续进行。

这里的关键判断是:Agentic AI的竞争壁垒正在从模型权重转向数据飞轮。谁能更快地把生产中的失败案例转化为训练信号,谁就能更快迭代。Forge的定位就是压缩这个循环的周期。Canva、Capital One、MasterClass是首批用户——注意,这些不是AI原生公司,是有真实业务场景的企业。这说明Forge的目标市场不只是AI实验室,而是任何需要部署Agent的企业。

对行业的三层影响

第一层,对云厂商。 CoreWeave是首批交付Vera Rubin NVL72的云厂商之一,且从收到机架到为Cognition跑起生产集群只用了几天。这个速度本身就是产品——它证明CoreWeave与NVIDIA的软硬件协同设计(从基础设施到token服务全栈)已经成熟到可以快速复制。对AWS、Azure、GCP来说,专用AI云在部署速度和全栈优化上的优势正在变得难以忽视。

第二层,对AI从业者。 如果你在做Agent产品,基础设施选型的逻辑正在变化。过去你关心的是"哪家GPU便宜",现在你需要关心的是"哪家能提供从训练到推理到评估到RL的完整闭环,且不锁定"。Forge声称保持开放,但实际迁移成本需要验证。Dynamo作为开源推理框架的存在,至少给了部分退出选项。

第三层,对NVIDIA自身。 这次发布是NVIDIA从"卖芯片"向"卖AI工厂"转型的又一证据。Vera CPU是NVIDIA第一款专为AI Agent设计的CPU,Vera Rubin NVL72是完整的机架级方案,Dynamo是开源推理框架,Nemotron是开放模型——NVIDIA正在把触角从计算延伸到网络、存储、软件、模型。Ian Buck说的"infrastructure that keeps earning for years"不只是说给CoreWeave听的,是说给所有正在犹豫是否押注NVIDIA生态的CTO听的。

还没被回答的问题

Cognition的4.8倍吞吐提升是在FrontierCode采样任务上测得的,这个负载的代表性有多广?不同Agent框架、不同模型、不同任务类型的提升曲线是否一致?这些数据没有公开。

Vera CPU的11,000个并发环境是在单机架内实现的,跨机架扩展时网络延迟和调度开销如何变化?Spectrum-X和BlueField-4的配合在更大规模下是否仍然线性?

Forge的"开放性"具体到什么程度?Weights & Biases被整合后,用户能否导出全部实验数据到第三方平台?marimo notebook的集成是深度绑定还是浅层调用?

这些问题的答案将决定这次发布是一次成功的产品迭代还是一次行业范式的真正转移。从目前公开的信息看,方向是清晰的,但细节仍需生产环境的检验。

其
AI前沿NVIDIACoreWeave智能体AIAI基础设施Vera Rubin