NVIDIA Vera CPU架构解析
Vera CPU采用88个NVIDIA自研Olympus核心、176线程和高带宽SOCAMM2 LPDDR5X,面向Agent沙箱、RL、数据处理与CPU—GPU一致性执行。
- Slug
nvidia-vera-cpu-architecture- 更新
- 2026-07-22
- 来源
- 4
- 关系
- 3
概览
NVIDIA Vera CPU采用88个NVIDIA自研、兼容Armv9.2-A的Olympus核心和176线程,强调满负载下的持续每线程性能、相对隔离、每核内存带宽与一致性数据移动。它既可作为Rubin GPU的Host,也规划单路、双路与CPU Rack形态。
Vera的主要架构包括10-wide解码、神经分支预测、深度乱序执行、Spatial Multithreading、第二代SCF、最高1.5TB SOCAMM2 LPDDR5X、NVLink-C2C、PCIe 6.4与CXL 3.1。
Vera CPU主要规格
| 项目 | 公开规格 | 说明 |
|---|---|---|
| 核心 / 线程 | 88个Olympus / 176线程 | NVIDIA自研、兼容Armv9.2-A |
| L1缓存 | 每核64KB L1I(4路)、96KB L1D(6路) | 指令与数据缓存分离 |
| L2 / L3 | 每核2MB L2、每CPU 164MB统一L3 | 统一L3连接全部核心 |
| SIMD | 每核6×128-bit SVE2,支持FP8 | 覆盖向量与数据处理 |
| SCF | 最高3.4TB/s双向截面带宽 | 连接核心、缓存、内存、I/O与NVLink-C2C |
| 内存 | 8个SOCAMM2;最高1.5TB LPDDR5X-9600、1.2TB/s | 最高约14GB/s每核 |
| NVLink-C2C | 最高1.8TB/s双向一致性带宽 | CPU—GPU或双路CPU连接 |
| I/O | PCI Express Base Specification 6.4、CXL 3.1 | PCIe 6.0代际;单路最多88条、双路176条通道 |
| 功耗 | 可配置TDP 250W—450W | 具体取决于平台与运行配置 |
为什么AI Agent需要不同的CPU设计
Agent推理包含模型生成之外的CPU工作:代码解释与编译、Python或JavaScript执行、数据库和浏览器调用、检索、压缩、静态分析、沙箱与调度。这些任务通常分支密集、指针密集、依赖链长并对尾延迟敏感。
系统还需并行运行大量环境。因此CPU既要提供单线程推进速度,也要在满插槽并发时保持内存带宽和延迟稳定。
Olympus核心的前端、乱序执行与缓存
Olympus使用10-wide解码与神经分支预测,分支预测子系统每周期最多可处理两条预测为跳转的分支。公开资料还披露了每周期最多获取16条64-bit指令和48条指令Decode Queue;这些都是前端上限,不代表每周期稳定完成同等数量的指令。
中端使用宽重命名与分配、较大的重排序缓冲区、内存重命名、值预测和关键路径加速;执行端包含4个Load、2个Store流水线与6组128-bit SVE2向量资源,其中部分支持加密运算。Graph Prefetcher用于不规则图和指针访问。
10-wide是解码能力上限,不代表每周期稳定完成10条指令。IPC仍受缓存、依赖、分支、编译器和软件实现影响。
Spatial Multithreading如何工作
每个Olympus核心运行两个硬件线程。NVIDIA称其Spatial Multithreading会更有效地划分宽核心资源:需要单线程性能时,主线程运行关键路径,兄弟线程处理管理活动;需要吞吐密度时,形成两个隔离程度更高的执行上下文。
该机制针对多沙箱和多租户中的资源争用与尾延迟。公开资料尚未说明所有资源的分区比例,实际隔离与性能仍需独立系统测试。
SCF、统一L3与SOCAMM2内存
第二代Scalable Coherency Fabric连接88个核心、164MB统一L3、内存控制器、I/O和NVLink-C2C,提供最高3.4TB/s双向截面带宽。该指标描述片上Fabric,不等于外部内存带宽。
SOCAMM2 LPDDR5X提供最高1.5TB容量和1.2TB/s聚合带宽。模块化设计使LPDDR5X具备现场更换和服务器RAS能力,适合高并发沙箱、RL、图分析、ETL与KV Cache卸载。
单NUMA、PCIe 6.4与CXL 3.1
每颗Vera对软件呈现一个NUMA域;双路系统为两个NUMA节点。统一计算裸片与L3减少片内跨Die路径,使线程和内存放置规则更清晰。双路仍需关注本地与远端内存访问。
Vera支持PCI Express Base Specification 6.4与CXL 3.1。这里的6.4是PCIe 6.0代际的规格版本,不是“PCIe 6×4”;单路最多88条、双路176条通道,速率为64GT/s。CXL可用于一致性内存扩展、池化与可组合基础设施,落地取决于主板、固件、操作系统和设备支持。
NVLink-C2C与CPU—GPU协同
NVLink-C2C提供最高1.8TB/s双向一致性带宽。在Vera Rubin平台的目标工作流中,Vera主要承接工具调用、数据处理和调度等CPU侧任务,Rubin主要承担模型计算;实际任务划分取决于框架、运行时和应用实现。
缓存一致性和统一地址空间能力可减少部分显式数据复制,并支持KV Cache卸载等技术;实际收益取决于CUDA、框架、内存管理和工作集访问方式,也不意味着LPDDR5X与HBM4具有无差别访问性能。
Vera也支持单路、双路和CPU Rack,并非只能与Rubin组合。截至2026年7月,Vera Rubin已进入全球量产爬坡和合作伙伴导入阶段;具体OEM配置、区域上市时间及国内供应状态以厂商后续信息为准。
Vera性能数据应如何理解
NVIDIA给出的“相对x86最高1.8倍”针对其选定的Agent CPU负载和满载时持续每线程性能,不代表Vera在全部CPU工作负载上普遍领先1.8倍。双路预生产Vera参考系统的SPECrate2026_int_base估算值为925,对照同样使用GNU 15.2的双路EPYC 9755为898。
该结果由NVIDIA于2026年7月内部测量并归类为估算值,不是SPEC正式提交。公开数据库中采用其他编译器和平台配置的EPYC 9755存在更高成绩,因此925对898不能作为通用CPU吞吐排名。NVIDIA尚未提供足够完整的同等级浮点数据,Olympus支持FP8也不等同于GPU Tensor Core级AI计算能力。
Phoronix已在NVIDIA提供的单路Vera平台上完成首轮Linux公开测试:88核176线程、8×96GB LPDDR5-9600、450W TDP、Ubuntu 24.04和GCC 16.1,覆盖编译、Python、Java、压缩、数据库与内存带宽等负载。该测试由第三方执行,但属于早期、有限平台验证。
机密计算、资源隔离与RAS
Vera支持Arm CCA与RME,以及RME-DA、RME-CDA设备分配、每VM加密密钥、TDISP设备隔离和C2C链路认证加密。MPAM可用于缓存与内存资源的分区和监控。这些能力与Spatial Multithreading共同服务多租户和沙箱场景,但最终可用性取决于Hypervisor、操作系统、固件、驱动和设备支持。
SOCAMM2平台公开的RAS能力包括ECC、错误记录、页下线、通道备用、模块现场更换和错误注入等。具体OEM系统会实现其中哪些能力,仍需查看厂商主板、固件和认证资料。
评估Agent服务器CPU可看哪些指标
- 满载下每线程性能和P95/P99延迟;
- 并发沙箱数量、工具类型和线程隔离;
- 每核内存带宽、总容量与数据访问模式;
- NUMA拓扑、CPU—GPU数据路径和设备亲和性;
- Arm软件兼容、容器镜像、编译器、驱动与运维工具;
- 实际业务的编译、Python、检索、数据库和评测循环。
Vera目前在国内尚未形成明确、稳定的产品供给。赋创持续关注新一代CPU与GPU协同架构,并结合Agent负载、内存需求、软件环境和扩展规划,为客户提供AI服务器配置与平台选型参考。
常见问题
Q1:Vera是Arm还是x86?
A:Vera使用NVIDIA自研、兼容Armv9.2-A的Olympus核心,不是x86处理器。
Q2:Vera能否独立作为服务器CPU?
A:可以。NVIDIA规划单路、双路与Vera CPU Rack,也可与Rubin GPU组成NVL72。
Q3:Vera为什么用LPDDR5X?
A:目标是以较低内存功耗提供高带宽;SOCAMM2使LPDDR5X具备模块化和现场更换能力。
Q4:单NUMA是否意味着不需要NUMA调优?
A:不是。每颗CPU一个NUMA域,双路仍是两个节点,仍需考虑线程、内存与设备亲和性。
方案咨询
需要把方案落到实际配置?
联系赋创获取算力、软件栈和交付路径建议。