硬件GPU

NVIDIA Rubin GPU架构解析

Rubin GPU面向大规模Agent与推理负载,重点升级HBM4带宽、低精度计算、MoE数据移动、长上下文注意力和GPU间通信。

NVIDIA RubinRubin GPUHBM4NVLink 6NVFP4MoEAI服务器大模型推理
Slug
nvidia-rubin-gpu-architecture
更新
2026-07-22
来源
5
关系
3

核心结论

NVIDIA Rubin GPU采用双计算裸片,集成3360亿个晶体管、224个SM与896个Tensor Core,最高配置为288GB HBM4和22TB/s峰值显存带宽。其主要变化覆盖低精度计算、显存、MoE数据移动、长上下文注意力、Kernel调度与NVLink通信。

NVIDIA公布的最高50 PFLOPS是Rubin单GPU的NVFP4预备峰值规格,官方规格表未将其标注为Dense specification;“最高10倍Agent吞吐/单位能耗”来自内部2T MoE平台级测试。两项数据都不能直接解释为Rubin单卡在所有模型上获得相同比例提升。

Rubin GPU主要规格

项目公开规格说明
封装双计算裸片,通过NV-HBI连接两个reticle-limited Compute Die在单封装内统一
计算资源3360亿晶体管、224个SM、896个Tensor Core采用第三代Transformer Engine
NVFP4最高50 PFLOPS推理预备峰值规格,官方未标注Dense
显存最高288GB HBM4、22TB/s容量与带宽分别影响模型常驻和Decode效率
NVLink 6最高3.6TB/s双向总带宽单GPU到NVLink交换系统的Scale-up口径
NVLink-C2C最高1.8TB/s双向一致性带宽CPU—GPU一致性通信
PCIePCIe 6.0代际x16:单向约128GB/s、双向合计约256GB/s主机侧I/O连接;Base Spec版本为6.4

计算架构与第三代Transformer Engine

Rubin以GPC组织SM,并配有集中式L2缓存。GigaThread Engine用于工作调度,MIG Control支持多工作负载分区,NV-DEC承担视频解码。第三代Transformer Engine在不同数值格式间调度Tensor Core,服务训练与推理。

Rubin将Tensor Core每时钟可处理的K维数据量提高一倍。对高Tensor Parallel下输出维度较小、归约维度较大的GEMM,可减少K循环次数与调度开销。该机制并不表示所有矩阵乘法性能固定翻倍。

TMA如何降低MoE数据移动开销

MoE会把Token动态路由到不同专家。专家权重分布在不同内存位置时,软件需要管理大量相似Tensor的地址与布局。Rubin增强Tensor Memory Accelerator,支持在TMA指令中内联更新内存指针、步幅等描述符字段。

布局相同、位置不同的专家Tensor可以复用基础描述符,从而减少描述符维护与内存更新。收益大小与专家数量、路由、并行策略、Tensor布局和框架实现有关。

长上下文注意力如何优化

Rubin可在稠密QKᵀ计算后,将注意力中间结果转换为结构化2:4稀疏表示。Softmax处理非零值,后续attention×V使用稀疏MMA,最终仍输出模型后续层所需的稠密格式。

相较Blackwell基线,NVIDIA公布的FP32指数吞吐为2倍,BF16/FP16为4倍,用于降低Softmax指数与归约步骤成为瓶颈的概率。该改进面向注意力路径,不等同于端到端推理提升比例。

288GB HBM4与22TB/s分别代表什么

显存容量决定权重、上下文与KV Cache能否常驻;显存带宽决定Decode阶段模型权重和KV状态的读取速度。Rubin最高288GB容量与最高配置的Blackwell Ultra相同,主要跨代变化是HBM4带宽达到22TB/s。

NVIDIA称该带宽相对Blackwell和Blackwell Ultra最高8TB/s约提升2.8倍。实际可用带宽还受访问模式、并行度、Kernel实现和内存局部性影响。

NVLink 6与GPU间同步

NVLink 6为单颗Rubin GPU提供最高3.6TB/s双向Scale-up总带宽,用于机架内GPU的All-to-All通信。Rubin新增counted writes,让接收GPU通过计数跟踪传输完成,减少屏障、确认与原子标志相关同步。

Rubin还支持更细粒度的依赖Kernel触发,消费者可在所需Tile数据到达后启动,减少生产者—消费者执行链中的空闲间隔。相关能力需要CUDA、编译器和推理框架配合。

Rubin在Vera Rubin NVL72中的位置

Vera Rubin NVL72集成72颗Rubin GPU与36颗Vera CPU,通过NVLink 6形成机架级GPU域,并使用NVLink-C2C连接CPU与GPU。多机架扩展可采用Spectrum-X Ethernet或Quantum-X InfiniBand。

平台还包含45°C液冷、Intelligent Power Smoothing和DSX MaxLPS。NVIDIA宣称DSX MaxLPS在特定运行点下可让固定电力预算容纳最高多40%的GPU,这是设施与平台级结果,不是单GPU性能数据。

官方性能数据的适用边界

公开说法测试范围正确表述
最高10倍Agent吞吐/单位能耗NVIDIA内部2T MoE;Vera Rubin平台对比Blackwell平台级特定负载结果,不能写成单卡普遍快10倍
50 PFLOPS NVFP4预备峰值;官方未标注Dense不自行写死为稠密或含稀疏性,仅用于同精度同口径比较
22TB/s HBM4峰值显存带宽实际带宽由软件、访问模式和负载决定

评估下一代推理GPU可看哪些指标

  • 模型权重精度与活跃参数量;
  • 显存容量、上下文长度、KV Cache和并发;
  • Prefill与Decode分别对应的计算与带宽需求;
  • Tensor Parallel、Expert Parallel及All-to-All通信占比;
  • TTFT、TPOT、Tokens/s、每瓦Token与有效显存带宽;
  • 机架功率、冷却温度、网络与故障维护条件。

截至2026年7月,Vera Rubin已进入全球量产爬坡和合作伙伴导入阶段;具体OEM配置、区域上市时间及国内供应状态仍需分别确认。赋创持续关注新一代GPU、互连与服务器平台的发展,并结合模型规模、计算精度、并发需求和部署环境,为客户评估更合适的AI服务器与集群方案。

常见问题

Q1:Rubin显存是否比Blackwell Ultra更大?
A:最高容量都为288GB;Rubin主要提升是HBM4带宽达到22TB/s。

Q2:Rubin适合MoE模型吗?
A:其TMA、NVLink与通信同步均针对MoE数据移动进行优化,但实际收益取决于模型、专家并行和软件实现。

Q3:NVLink 6带宽是多少?
A:单GPU连接NVLink交换系统的双向Scale-up总带宽最高3.6TB/s。

Q4:Rubin何时可用?
A:NVIDIA公布Vera Rubin平台于2026年进入量产与合作伙伴导入,具体区域、OEM配置和交付时间以官方与厂商信息为准。

方案咨询

需要把方案落到实际配置?

联系赋创获取算力、软件栈和交付路径建议。

咨询方案浏览指南