返回行业情报

英伟达Vera CPU正式交付,专为智能体AI打造

Delivering Vera: NVIDIA’s First CPU Built for Agents Is Shipping Now

英伟达副总裁Ian Buck亲自将首批Vera CPU系统交付给AWS、Oracle Cloud及Anthropic、OpenAI、SpaceXAI等AI实验室。Vera是英伟达首款定制CPU,配备88个奥林巴斯核心、1.2TB/s内存带宽,专为智能体AI的编排、工具调用等并发实时任务设计,性能提升达1.8倍。AWS计划部署200万块GPU,OCI将部署数十万块Vera CPU。

深度解读

英伟达第一颗为智能体时代定制的CPU Vera已经正式发货,并且由英伟达高管亲自送货上门给到AWS、Oracle和三大顶级AI实验室,这标志着AI基础设施的竞争焦点正从单一的GPU算力转向CPU与GPU协同的“AI工厂”整体效率。

为什么是CPU?为什么是现在?

文章开篇抛出一个关键判断:智能体AI正在创造“AI工厂中的新CPU时刻”。过去两年,业界所有的目光都聚焦在GPU上,H100、A100、H200的短缺和性能几乎是每场发布会的核心议题。但英伟达这篇博客的潜台词非常清晰:当AI从“回答问题”走向“采取行动”时,CPU成了新的瓶颈。一个智能体要完成“帮我做一份幻灯片并编译测试代码”这样的任务,它需要调用工具、运行Python脚本、检索长上下文、管理沙箱环境——这些环节全是CPU的活儿,GPU只负责其中一小部分矩阵运算。如果CPU太慢,GPU再快也只能空转等待数据。所以英伟达推出Vera,本质上是在补全“AI工厂”的最后一块拼图。

Vera的技术底牌:88核与1.8倍性能

Vera的规格参数直接对标这个新需求。它搭载了88个英伟达自研的Olympus核心,内存带宽高达1.2TB/s,在智能体AI工作负载下的单核性能比传统方案快1.8倍。这几个数字背后是截然不同的设计哲学。传统CPU追求核心数量多、通用性强,但智能体AI的工作负载特点是并发实时任务多、单线程延迟敏感——比如一个智能体同时发起了十几个工具调用,每个调用都在等CPU快速响应。Vera用高主频、大带宽的定制核心来压低延迟,而不是靠堆核心数来跑满吞吐。英伟达副总裁Ian Buck的解释很直白:当模型被问到一个问题时,答案往往不是现成的,模型需要先生成一段Python代码去计算,这个“生成代码并执行”的过程对CPU的要求极高。

从发布到交付:一场精心策划的营销闪电战

这篇博客的叙事主线是Ian Buck的“送货之旅”,时间线从2026年5月18日持续到8月27日,覆盖了Anthropic、OpenAI、SpaceXAI、Oracle和AWS。这绝不仅仅是物流新闻,而是英伟达向市场释放的强烈信号:Vera不是PPT产品,是已经可以跑客户负载的真机器。尤其值得注意的是交付顺序——先是Anthropic和OpenAI这两个最前沿的AI实验室,然后是马斯克的SpaceXAI,接着是Oracle,最后才是AWS。这个顺序透露了英伟达的优先级:先让最挑剔的算法客户用起来,再搞定最大的云厂商。AWS作为全球最大的云服务商,直到8月才收到货,且英伟达同时宣布了追加200万颗GPU的合作计划,这说明AWS的谈判筹码更大,也可能意味着Vera在AWS的部署规模会远超其他云厂商。

谁在真正需要Vera?——从Oracle的表态看企业市场

Oracle Cloud Infrastructure(OCI)是第一个宣布大规模部署Vera的云厂商,计划从2026年开始部署“数十万颗”Vera CPU。这个数字非常惊人,远超实验室的采购量级。OCI的高管Karan Batta给出的理由是“智能体AI需要在大规模下维持持续性能”。对于企业客户来说,Oracle的AI客户体验中心已经摆上了Vera系统,这意味着企业可以实际测试自己的智能体负载,而不是听英伟达的发布会吹牛。这标志着智能体AI从实验室走向生产环境的关键转折——企业不再需要自己搭建GPU集群,而是可以直接在云上租用为智能体优化的CPU算力。Oracle敢下这么大的订单,说明他们已经看到了企业客户对智能体工作负载的真实需求,而不是在赌未来。

OpenAI与Anthropic的微妙姿态

博客中关于OpenAI的细节值得玩味。Ian Buck在OpenAI的Mission Bay总部阳台上,从口袋里掏出螺丝刀,直接打开服务器盖子展示内部结构。这种“当场拆机”的举动,一方面展现了Vera设计的自信,另一方面也暗示OpenAI的工程师们对硬件细节极度关注。Anthropic的James Bradbury则更含蓄,只说“扩展算力是模型增长的重要加速器”,并称Vera是“生态系统中一个有前景的部分”。这两家实验室的表态都冷静而克制,没有夸夸其谈,因为对于他们来说,Vera只是众多算力选项之一,他们真正关心的是每美元能训练出多少模型能力。但英伟达愿意把首台机器送给他们,说明在英伟达的战略版图中,顶级AI实验室的背书比云厂商的订单更有说服力——毕竟云厂商卖的是算力,实验室定义的是算法方向。

SpaceXAI与强化学习的特殊需求

马斯克的SpaceXAI是这次交付中最特殊的客户。他们正在评估Vera用于强化学习(RL)工作负载和基于智能体的仿真管线。强化学习是当前AI训练中最烧算力的环节之一,尤其是RLHF(基于人类反馈的强化学习),需要大量的试错迭代,每次试错都涉及环境模拟、策略推理和奖励计算,这些任务高度依赖CPU的实时响应能力。马斯克当场问的核心、内存布局和散热细节,说明SpaceXAI的工程师已经在认真考虑把Vera整合进他们的训练栈。如果Vera能在RL场景中证明价值,那它的市场空间将远超推理场景,因为RL是通往超级智能的关键路径,任何能加速RL的硬件都会成为战略资源。

与Rubin GPU的组合拳:统一内存架构

Vera并非孤立产品,它是英伟达“极限协同设计”(extreme codesign)战略的一部分,与Rubin GPU、BlueField-4 DPU、Spectrum-X网络和MGX机架架构共同构成完整方案。在Vera Rubin NVL72系统中,Vera通过第二代NVLink-C2C与一对Rubin GPU配对,共享统一内存架构。这意味着CPU和GPU不再通过PCIe总线慢速通信,而是直接访问同一块内存池。这种设计的直接收益是GPU利用率大幅提升——传统架构中,GPU经常因为等待CPU喂数据而闲置,统一内存让数据搬运的延迟几乎消失。英伟达给出的数据是2倍能效提升,这在电力成本占运营大头的数据中心里是决定性的竞争力。

对行业格局的深层影响:英伟达的“平台税”焦虑

从更宏观的视角看,Vera的发布是英伟达对抗“XPU”多元化趋势的关键棋子。过去两年,谷歌的TPU、亚马逊的Trainium、微软的Maia都在尝试用专用芯片替代英伟达GPU。英伟达的回应是:你们只替代了GPU,但AI工厂需要的不只是GPU,还有CPU、DPU、网络和机架。通过推出自研CPU,英伟达把触角伸向了服务器的心脏地带,直接与Intel和AMD的至强、霄龙系列竞争。这对云厂商来说是个两难选择:要么继续用Intel/AMD CPU搭配英伟达GPU,这样至少保留了一部分议价权;要么全盘采用英伟达的Vera+Rubin方案,获得最佳性能但彻底被绑定在英伟达生态里。AWS的接受态度尤其值得关注——他们一边自研Trainium,一边接受英伟达的Vera CPU,这说明AWS的算力策略是“全都要”,但英伟达显然希望用Vera把客户的忠诚度锁得更紧。

对从业者的启示:CPU技能重新吃香

对于AI工程师和基础设施团队来说,Vera的出现意味着一个被忽视多年的技能重新变得重要:CPU性能调优。过去几年,大家的注意力都在CUDA编程、GPU显存优化、分布式训练框架上,很少有人关注CPU的指令集、缓存一致性、内存带宽。但智能体AI的编排层、工具调用层、长上下文管理这些环节,全都在CPU上运行。如果你的代码让CPU产生了大量的缓存未命中或上下文切换,Vera的1.8倍性能优势也会被抵消大半。未来AI系统的性能瓶颈可能不在GPU而在CPU,那些懂得在CPU层面优化智能体运行时开销的工程师,将获得巨大的职业红利。

时间线背后的商业逻辑:为什么是2026年?

最后回到时间线。博客最初发布于2026年5月18日,更新于8月27日,这意味着Vera的交付周期只有三个多月。这个速度在芯片行业堪称惊人——通常一款新CPU从流片到量产需要一年以上。英伟达能在如此短时间内完成从发布到规模交付,说明Vera的研发早在2024年甚至更早就已启动,且英伟达对智能体AI的爆发早有预判。2026年这个时间点也恰好是智能体从demo走向生产的关键窗口期,各家云厂商都在疯狂寻找能支撑大规模智能体工作负载的算力方案。英伟达选择在这个时间点把Vera推向市场,既是对自身GPU业务的防御性补充,也是对竞争对手的进攻性压制——当客户发现“英伟达全家桶”能提供2倍能效时,谁还会去折腾异构芯片的集成难题?

AI前沿NVIDIAVera CPU智能体AI