NVIDIA Rubin GPU架构解析
Rubin GPU面向大规模Agent与推理负载,重点升级HBM4带宽、低精度计算、MoE数据移动、长上下文注意力和GPU间通信。
- Slug
nvidia-rubin-gpu-architecture- 更新
- 2026-07-22
- 来源
- 5
- 关系
- 3
核心结论
NVIDIA Rubin GPU采用双计算裸片,集成3360亿个晶体管、224个SM与896个Tensor Core,最高配置为288GB HBM4和22TB/s峰值显存带宽。其主要变化覆盖低精度计算、显存、MoE数据移动、长上下文注意力、Kernel调度与NVLink通信。
NVIDIA公布的最高50 PFLOPS是Rubin单GPU的NVFP4预备峰值规格,官方规格表未将其标注为Dense specification;“最高10倍Agent吞吐/单位能耗”来自内部2T MoE平台级测试。两项数据都不能直接解释为Rubin单卡在所有模型上获得相同比例提升。
Rubin GPU主要规格
| 项目 | 公开规格 | 说明 |
|---|---|---|
| 封装 | 双计算裸片,通过NV-HBI连接 | 两个reticle-limited Compute Die在单封装内统一 |
| 计算资源 | 3360亿晶体管、224个SM、896个Tensor Core | 采用第三代Transformer Engine |
| NVFP4 | 最高50 PFLOPS推理 | 预备峰值规格,官方未标注Dense |
| 显存 | 最高288GB HBM4、22TB/s | 容量与带宽分别影响模型常驻和Decode效率 |
| NVLink 6 | 最高3.6TB/s双向总带宽 | 单GPU到NVLink交换系统的Scale-up口径 |
| NVLink-C2C | 最高1.8TB/s双向一致性带宽 | CPU—GPU一致性通信 |
| PCIe | PCIe 6.0代际x16:单向约128GB/s、双向合计约256GB/s | 主机侧I/O连接;Base Spec版本为6.4 |
计算架构与第三代Transformer Engine
Rubin以GPC组织SM,并配有集中式L2缓存。GigaThread Engine用于工作调度,MIG Control支持多工作负载分区,NV-DEC承担视频解码。第三代Transformer Engine在不同数值格式间调度Tensor Core,服务训练与推理。
Rubin将Tensor Core每时钟可处理的K维数据量提高一倍。对高Tensor Parallel下输出维度较小、归约维度较大的GEMM,可减少K循环次数与调度开销。该机制并不表示所有矩阵乘法性能固定翻倍。
TMA如何降低MoE数据移动开销
MoE会把Token动态路由到不同专家。专家权重分布在不同内存位置时,软件需要管理大量相似Tensor的地址与布局。Rubin增强Tensor Memory Accelerator,支持在TMA指令中内联更新内存指针、步幅等描述符字段。
布局相同、位置不同的专家Tensor可以复用基础描述符,从而减少描述符维护与内存更新。收益大小与专家数量、路由、并行策略、Tensor布局和框架实现有关。
长上下文注意力如何优化
Rubin可在稠密QKᵀ计算后,将注意力中间结果转换为结构化2:4稀疏表示。Softmax处理非零值,后续attention×V使用稀疏MMA,最终仍输出模型后续层所需的稠密格式。
相较Blackwell基线,NVIDIA公布的FP32指数吞吐为2倍,BF16/FP16为4倍,用于降低Softmax指数与归约步骤成为瓶颈的概率。该改进面向注意力路径,不等同于端到端推理提升比例。
288GB HBM4与22TB/s分别代表什么
显存容量决定权重、上下文与KV Cache能否常驻;显存带宽决定Decode阶段模型权重和KV状态的读取速度。Rubin最高288GB容量与最高配置的Blackwell Ultra相同,主要跨代变化是HBM4带宽达到22TB/s。
NVIDIA称该带宽相对Blackwell和Blackwell Ultra最高8TB/s约提升2.8倍。实际可用带宽还受访问模式、并行度、Kernel实现和内存局部性影响。
NVLink 6与GPU间同步
NVLink 6为单颗Rubin GPU提供最高3.6TB/s双向Scale-up总带宽,用于机架内GPU的All-to-All通信。Rubin新增counted writes,让接收GPU通过计数跟踪传输完成,减少屏障、确认与原子标志相关同步。
Rubin还支持更细粒度的依赖Kernel触发,消费者可在所需Tile数据到达后启动,减少生产者—消费者执行链中的空闲间隔。相关能力需要CUDA、编译器和推理框架配合。
Rubin在Vera Rubin NVL72中的位置
Vera Rubin NVL72集成72颗Rubin GPU与36颗Vera CPU,通过NVLink 6形成机架级GPU域,并使用NVLink-C2C连接CPU与GPU。多机架扩展可采用Spectrum-X Ethernet或Quantum-X InfiniBand。
平台还包含45°C液冷、Intelligent Power Smoothing和DSX MaxLPS。NVIDIA宣称DSX MaxLPS在特定运行点下可让固定电力预算容纳最高多40%的GPU,这是设施与平台级结果,不是单GPU性能数据。
官方性能数据的适用边界
| 公开说法 | 测试范围 | 正确表述 |
|---|---|---|
| 最高10倍Agent吞吐/单位能耗 | NVIDIA内部2T MoE;Vera Rubin平台对比Blackwell | 平台级特定负载结果,不能写成单卡普遍快10倍 |
| 50 PFLOPS NVFP4 | 预备峰值;官方未标注Dense | 不自行写死为稠密或含稀疏性,仅用于同精度同口径比较 |
| 22TB/s HBM4 | 峰值显存带宽 | 实际带宽由软件、访问模式和负载决定 |
评估下一代推理GPU可看哪些指标
- 模型权重精度与活跃参数量;
- 显存容量、上下文长度、KV Cache和并发;
- Prefill与Decode分别对应的计算与带宽需求;
- Tensor Parallel、Expert Parallel及All-to-All通信占比;
- TTFT、TPOT、Tokens/s、每瓦Token与有效显存带宽;
- 机架功率、冷却温度、网络与故障维护条件。
截至2026年7月,Vera Rubin已进入全球量产爬坡和合作伙伴导入阶段;具体OEM配置、区域上市时间及国内供应状态仍需分别确认。赋创持续关注新一代GPU、互连与服务器平台的发展,并结合模型规模、计算精度、并发需求和部署环境,为客户评估更合适的AI服务器与集群方案。
常见问题
Q1:Rubin显存是否比Blackwell Ultra更大?
A:最高容量都为288GB;Rubin主要提升是HBM4带宽达到22TB/s。
Q2:Rubin适合MoE模型吗?
A:其TMA、NVLink与通信同步均针对MoE数据移动进行优化,但实际收益取决于模型、专家并行和软件实现。
Q3:NVLink 6带宽是多少?
A:单GPU连接NVLink交换系统的双向Scale-up总带宽最高3.6TB/s。
Q4:Rubin何时可用?
A:NVIDIA公布Vera Rubin平台于2026年进入量产与合作伙伴导入,具体区域、OEM配置和交付时间以官方与厂商信息为准。
方案咨询
需要把方案落到实际配置?
联系赋创获取算力、软件栈和交付路径建议。