硬件CPU

NVIDIA Vera CPU架构解析

Vera CPU采用88个NVIDIA自研Olympus核心、176线程和高带宽SOCAMM2 LPDDR5X,面向Agent沙箱、RL、数据处理与CPU—GPU一致性执行。

NVIDIA VeraVera CPUOlympusSOCAMM2LPDDR5XNVLink-C2CAI Agent服务器CPU
Slug
nvidia-vera-cpu-architecture
更新
2026-07-22
来源
4
关系
3

概览

NVIDIA Vera CPU采用88个NVIDIA自研、兼容Armv9.2-A的Olympus核心和176线程,强调满负载下的持续每线程性能、相对隔离、每核内存带宽与一致性数据移动。它既可作为Rubin GPU的Host,也规划单路、双路与CPU Rack形态。

Vera的主要架构包括10-wide解码、神经分支预测、深度乱序执行、Spatial Multithreading、第二代SCF、最高1.5TB SOCAMM2 LPDDR5X、NVLink-C2C、PCIe 6.4与CXL 3.1。

Vera CPU主要规格

项目公开规格说明
核心 / 线程88个Olympus / 176线程NVIDIA自研、兼容Armv9.2-A
L1缓存每核64KB L1I(4路)、96KB L1D(6路)指令与数据缓存分离
L2 / L3每核2MB L2、每CPU 164MB统一L3统一L3连接全部核心
SIMD每核6×128-bit SVE2,支持FP8覆盖向量与数据处理
SCF最高3.4TB/s双向截面带宽连接核心、缓存、内存、I/O与NVLink-C2C
内存8个SOCAMM2;最高1.5TB LPDDR5X-9600、1.2TB/s最高约14GB/s每核
NVLink-C2C最高1.8TB/s双向一致性带宽CPU—GPU或双路CPU连接
I/OPCI Express Base Specification 6.4、CXL 3.1PCIe 6.0代际;单路最多88条、双路176条通道
功耗可配置TDP 250W—450W具体取决于平台与运行配置

为什么AI Agent需要不同的CPU设计

Agent推理包含模型生成之外的CPU工作:代码解释与编译、Python或JavaScript执行、数据库和浏览器调用、检索、压缩、静态分析、沙箱与调度。这些任务通常分支密集、指针密集、依赖链长并对尾延迟敏感。

系统还需并行运行大量环境。因此CPU既要提供单线程推进速度,也要在满插槽并发时保持内存带宽和延迟稳定。

Olympus核心的前端、乱序执行与缓存

Olympus使用10-wide解码与神经分支预测,分支预测子系统每周期最多可处理两条预测为跳转的分支。公开资料还披露了每周期最多获取16条64-bit指令和48条指令Decode Queue;这些都是前端上限,不代表每周期稳定完成同等数量的指令。

中端使用宽重命名与分配、较大的重排序缓冲区、内存重命名、值预测和关键路径加速;执行端包含4个Load、2个Store流水线与6组128-bit SVE2向量资源,其中部分支持加密运算。Graph Prefetcher用于不规则图和指针访问。

10-wide是解码能力上限,不代表每周期稳定完成10条指令。IPC仍受缓存、依赖、分支、编译器和软件实现影响。

Spatial Multithreading如何工作

每个Olympus核心运行两个硬件线程。NVIDIA称其Spatial Multithreading会更有效地划分宽核心资源:需要单线程性能时,主线程运行关键路径,兄弟线程处理管理活动;需要吞吐密度时,形成两个隔离程度更高的执行上下文。

该机制针对多沙箱和多租户中的资源争用与尾延迟。公开资料尚未说明所有资源的分区比例,实际隔离与性能仍需独立系统测试。

SCF、统一L3与SOCAMM2内存

第二代Scalable Coherency Fabric连接88个核心、164MB统一L3、内存控制器、I/O和NVLink-C2C,提供最高3.4TB/s双向截面带宽。该指标描述片上Fabric,不等于外部内存带宽。

SOCAMM2 LPDDR5X提供最高1.5TB容量和1.2TB/s聚合带宽。模块化设计使LPDDR5X具备现场更换和服务器RAS能力,适合高并发沙箱、RL、图分析、ETL与KV Cache卸载。

单NUMA、PCIe 6.4与CXL 3.1

每颗Vera对软件呈现一个NUMA域;双路系统为两个NUMA节点。统一计算裸片与L3减少片内跨Die路径,使线程和内存放置规则更清晰。双路仍需关注本地与远端内存访问。

Vera支持PCI Express Base Specification 6.4与CXL 3.1。这里的6.4是PCIe 6.0代际的规格版本,不是“PCIe 6×4”;单路最多88条、双路176条通道,速率为64GT/s。CXL可用于一致性内存扩展、池化与可组合基础设施,落地取决于主板、固件、操作系统和设备支持。

NVLink-C2C与CPU—GPU协同

NVLink-C2C提供最高1.8TB/s双向一致性带宽。在Vera Rubin平台的目标工作流中,Vera主要承接工具调用、数据处理和调度等CPU侧任务,Rubin主要承担模型计算;实际任务划分取决于框架、运行时和应用实现。

缓存一致性和统一地址空间能力可减少部分显式数据复制,并支持KV Cache卸载等技术;实际收益取决于CUDA、框架、内存管理和工作集访问方式,也不意味着LPDDR5X与HBM4具有无差别访问性能。

Vera也支持单路、双路和CPU Rack,并非只能与Rubin组合。截至2026年7月,Vera Rubin已进入全球量产爬坡和合作伙伴导入阶段;具体OEM配置、区域上市时间及国内供应状态以厂商后续信息为准。

Vera性能数据应如何理解

NVIDIA给出的“相对x86最高1.8倍”针对其选定的Agent CPU负载和满载时持续每线程性能,不代表Vera在全部CPU工作负载上普遍领先1.8倍。双路预生产Vera参考系统的SPECrate2026_int_base估算值为925,对照同样使用GNU 15.2的双路EPYC 9755为898。

该结果由NVIDIA于2026年7月内部测量并归类为估算值,不是SPEC正式提交。公开数据库中采用其他编译器和平台配置的EPYC 9755存在更高成绩,因此925对898不能作为通用CPU吞吐排名。NVIDIA尚未提供足够完整的同等级浮点数据,Olympus支持FP8也不等同于GPU Tensor Core级AI计算能力。

Phoronix已在NVIDIA提供的单路Vera平台上完成首轮Linux公开测试:88核176线程、8×96GB LPDDR5-9600、450W TDP、Ubuntu 24.04和GCC 16.1,覆盖编译、Python、Java、压缩、数据库与内存带宽等负载。该测试由第三方执行,但属于早期、有限平台验证。

机密计算、资源隔离与RAS

Vera支持Arm CCA与RME,以及RME-DA、RME-CDA设备分配、每VM加密密钥、TDISP设备隔离和C2C链路认证加密。MPAM可用于缓存与内存资源的分区和监控。这些能力与Spatial Multithreading共同服务多租户和沙箱场景,但最终可用性取决于Hypervisor、操作系统、固件、驱动和设备支持。

SOCAMM2平台公开的RAS能力包括ECC、错误记录、页下线、通道备用、模块现场更换和错误注入等。具体OEM系统会实现其中哪些能力,仍需查看厂商主板、固件和认证资料。

评估Agent服务器CPU可看哪些指标

  • 满载下每线程性能和P95/P99延迟;
  • 并发沙箱数量、工具类型和线程隔离;
  • 每核内存带宽、总容量与数据访问模式;
  • NUMA拓扑、CPU—GPU数据路径和设备亲和性;
  • Arm软件兼容、容器镜像、编译器、驱动与运维工具;
  • 实际业务的编译、Python、检索、数据库和评测循环。

Vera目前在国内尚未形成明确、稳定的产品供给。赋创持续关注新一代CPU与GPU协同架构,并结合Agent负载、内存需求、软件环境和扩展规划,为客户提供AI服务器配置与平台选型参考。

常见问题

Q1:Vera是Arm还是x86?
A:Vera使用NVIDIA自研、兼容Armv9.2-A的Olympus核心,不是x86处理器。

Q2:Vera能否独立作为服务器CPU?
A:可以。NVIDIA规划单路、双路与Vera CPU Rack,也可与Rubin GPU组成NVL72。

Q3:Vera为什么用LPDDR5X?
A:目标是以较低内存功耗提供高带宽;SOCAMM2使LPDDR5X具备模块化和现场更换能力。

Q4:单NUMA是否意味着不需要NUMA调优?
A:不是。每颗CPU一个NUMA域,双路仍是两个节点,仍需考虑线程、内存与设备亲和性。

方案咨询

需要把方案落到实际配置?

联系赋创获取算力、软件栈和交付路径建议。

咨询方案浏览指南