NVIDIA DGX 与 HGX 有什么区别
DGX 是 NVIDIA 提供的完整品牌化AI系统,HGX是供OEM集成的GPU、NVLink与NVSwitch计算平台。本文从硬件范围、软件、支持、定制、交付与集群扩展说明两者差异。
- Slug
nvidia-dgx-vs-hgx- 更新
- 2026-07-03
- 来源
- 5
- 关系
- 5
概述
NVIDIA DGX和HGX都面向AI与高性能计算,但并不是同一种产品。DGX是由NVIDIA定义、集成并以NVIDIA品牌交付的完整系统或平台,通常包含GPU、CPU、内存、存储、网络、机箱、供电、系统软件和NVIDIA企业支持。
HGX更接近GPU计算平台或基础模块。它以多GPU基板、NVLink、NVSwitch、管理控制器及相关参考设计为核心,由服务器OEM或系统厂商集成CPU、内存、存储、网卡、机箱、散热和BMC,最终形成不同品牌和配置的HGX服务器。
一句话理解DGX与HGX
- DGX:NVIDIA提供的完整、固定度较高、经过端到端验证的品牌化AI系统。
- HGX:NVIDIA提供给OEM和系统厂商集成的多GPU计算平台,可形成不同配置的服务器。
两者可能使用相同代际的GPU、NVLink和NVSwitch,因此核心GPU计算能力可以接近;真正的差异主要体现在整机组成、配置自由度、软件预集成、支持主体、交付模式和集群参考架构。
核心差异对比
| 维度 | NVIDIA DGX | NVIDIA HGX |
|---|---|---|
| 产品性质 | NVIDIA品牌完整AI系统与平台 | 供OEM集成的GPU计算平台和参考架构 |
| 交付主体 | NVIDIA及其授权渠道 | 服务器OEM、系统厂商和集成商 |
| 核心GPU模块 | 通常基于对应代际HGX/NVLink计算基础 | 多GPU基板、NVLink、NVSwitch及管理组件 |
| CPU与内存 | 由具体DGX型号固定 | 由HGX代际、OEM设计和认证配置决定 |
| 本地存储 | 预定义系统盘和数据缓存方案 | OEM可按机箱和客户需求配置 |
| 网络 | 预定义ConnectX/SuperNIC及管理接口 | 可按参考架构配置不同数量和型号的网卡 |
| 软件 | 提供DGX验证的软件环境、系统工具和企业支持路径 | 需要OEM、集成商和客户完成操作系统及软件栈验证 |
| 固件管理 | NVIDIA提供DGX整机固件包和升级流程 | 由OEM协调服务器、HGX基板、BMC、BIOS和其他固件 |
| 配置自由度 | 相对较低,强调一致性和标准化 | 相对较高,可调整CPU、内存、存储、网络和机箱 |
| 支持模式 | NVIDIA DGX Enterprise Support覆盖硬件与软件支持 | 硬件通常由OEM或系统供应商支持,NVIDIA软件支持按授权与订阅确定 |
| 适合客户 | 希望降低集成风险、采用标准平台和统一支持的客户 | 需要定制配置、现有供应体系或成本结构优化的客户 |
DGX 是什么
DGX是NVIDIA面向企业AI、训练、推理和数据分析提供的完整系统系列。以DGX H100/H200和DGX B200为例,系统已经明确配置GPU、CPU、内存、NVSwitch、系统盘、数据缓存盘、集群网络和管理接口,并提供BMC、固件更新、DGX系统软件和企业支持流程。
DGX的价值不只是“八张GPU”。其核心是将计算、网络、存储、系统软件、验证基线和支持体系组合为一个标准平台,便于复制为DGX BasePOD或DGX SuperPOD集群。
DGX通常包括哪些内容
- 固定型号和数量的NVIDIA数据中心GPU。
- NVLink与NVSwitch节点内高速互联。
- 经过验证的CPU、主机内存和PCIe拓扑。
- 系统盘、本地NVMe数据缓存及相应RAID设计。
- ConnectX或SuperNIC高速网络和管理网络。
- BMC、Redfish、诊断和固件管理工具。
- DGX验证的软件环境和NVIDIA企业支持。
- 面向BasePOD、SuperPOD及存储网络的参考架构。
HGX 是什么
HGX是NVIDIA的数据中心加速计算平台系列。其核心通常是由多张SXM GPU、NVLink、NVSwitch、基板管理控制器和相关I/O组成的HGX基板,再由OEM将其集成到完整服务器中。
HGX本身不等同于最终交付的整机型号。即使都采用HGX H200或HGX B200,不同OEM服务器的CPU、内存容量、NVMe数量、网卡、机箱高度、电源、风冷或液冷方式、BMC功能和服务体系仍可能不同。
HGX服务器通常由谁完成集成
- NVIDIA提供HGX计算平台、固件要求和参考架构。
- OEM设计主板、CPU、内存、存储、机箱、供电和散热。
- 服务器厂商完成系统验证、BMC与BIOS集成。
- 系统集成商或解决方案商完成网络、存储、集群和业务软件部署。
- 硬件售后主要依据具体OEM和供应商合同。
相同GPU的DGX一定比HGX更快吗
不一定。若DGX和某款HGX服务器采用相同GPU数量、相同NVLink/NVSwitch代际和相近功率配置,GPU理论计算能力和节点内互联可以非常接近。
实际性能差异通常来自以下因素:
- CPU型号、内存容量和内存带宽。
- GPU、CPU、NIC和NVMe的PCIe与NUMA拓扑。
- 网卡数量、速率和GPU Direct路径。
- 本地数据缓存与共享存储吞吐。
- GPU功率限制、风量、液冷和持续频率。
- BIOS、固件、驱动、CUDA和NCCL版本。
- 容器、框架和模型优化程度。
因此,DGX与HGX的比较重点不应是“哪个名字性能更强”,而应核对完整系统配置和统一测试环境。
以H200八卡系统为例
| 维度 | DGX H200 | HGX H200服务器 |
|---|---|---|
| GPU | 固定8张H200,合计1,128GB HBM3E | 核心HGX基板通常为8张H200,具体整机以OEM为准 |
| NVLink/NVSwitch | 固定的第四代NVLink与NVSwitch架构 | 采用HGX H200基板的第四代NVLink与NVSwitch |
| CPU | 由DGX H200标准配置确定 | 可由OEM在认证范围内选择AMD EPYC或Intel Xeon等平台 |
| 主机内存 | 固定系统规格 | 可根据OEM机型和项目配置 |
| 本地存储 | 系统盘和8块NVMe数据缓存等固定设计 | 不同OEM在数量、容量和RAID上存在差异 |
| 网络 | 预配置ConnectX-7高速网络 | 按OEM和项目选择网卡数量与速率 |
| 软件与支持 | DGX软件、固件和NVIDIA企业支持路径 | OEM硬件支持,加上选购的NVIDIA软件支持 |
表格用于说明产品边界,不代表所有HGX H200整机均可自由配置。OEM必须遵循NVIDIA和自身认证要求,客户应以具体服务器数据表为准。
以B200八卡系统为例
DGX B200是一台已经定义完整配置的NVIDIA系统,官方用户指南列出8张B200、1,440GB总GPU显存、双路Intel Xeon CPU、NVSwitch、系统盘、数据缓存盘及网络接口。
HGX B200则首先是一块由8张B200及第五代NVLink/NVSwitch构成的计算基板。OEM可以围绕该基板设计不同的x86服务器,在CPU、内存、存储、网卡、风冷或液冷和机箱结构上形成差异。
软件和固件有什么差异
DGX的软件特点
- 提供经过NVIDIA验证的DGX系统软件或DGX OS路径。
- 硬件、驱动、固件和系统工具有相对统一的升级流程。
- 可使用NGC、NVIDIA AI Enterprise和Base Command等软件。
- 问题可通过NVIDIA DGX Enterprise Support进行升级处理。
HGX的软件特点
- 操作系统和驱动版本由OEM、集成商与客户共同确定。
- 需要同时管理OEM BIOS/BMC与NVIDIA HGX基板固件。
- 可部署CUDA、NCCL、Fabric Manager和NVIDIA AI Enterprise。
- 升级前必须核对服务器厂商的支持矩阵和BKC。
- 问题定位可能涉及OEM、NVIDIA软件和第三方组件多个责任方。
支持和售后如何区分
DGX系统包含明确的NVIDIA企业支持路径,覆盖DGX硬件、软件和诊断流程。HGX服务器的整机硬件支持通常由OEM或系统供应商承担,GPU平台和NVIDIA软件相关支持则依据具体授权、订阅和合作流程处理。
采购HGX服务器时,应提前确认:
- 整机、GPU、网卡和存储分别由谁提供保修。
- BIOS、BMC和HGX固件升级由谁负责。
- NVIDIA AI Enterprise是否包含在报价中。
- 是否提供现场服务、备件和故障响应时效。
- 多节点网络和存储问题由哪一方统一协调。
配置自由度为什么不同
DGX强调标准化。相同DGX型号在主要硬件和软件配置上保持一致,有利于快速复制、集群扩容和官方支持,但客户可修改的空间相对有限。
HGX强调OEM集成。客户可以在认证范围内选择CPU平台、内存容量、本地存储、网络和机箱冷却,更容易适配既有采购体系和数据中心条件,但也需要承担更多选型、兼容和验收工作。
集群扩展有什么差异
DGX可以按照NVIDIA DGX BasePOD、DGX SuperPOD和相应网络、存储参考架构扩展,强调端到端标准化和可重复部署。
HGX服务器也可以构建大规模集群,但需要围绕具体OEM节点重新规划计算网络、存储网络、管理网络、机柜功率、冷却和调度平台。NVIDIA提供HGX AI Factory与企业参考架构,但最终实施仍由OEM、网络存储伙伴和集成商共同完成。
什么情况下优先选择DGX
- 希望采用NVIDIA定义的标准整机和软件环境。
- 希望减少CPU、存储、网络和固件选型工作。
- 需要NVIDIA统一的企业支持和问题升级路径。
- 计划按照DGX BasePOD或SuperPOD方式扩展。
- 项目时间紧,对集成风险和可复制性要求高。
- 预算允许为标准化、支持和交付确定性付费。
什么情况下优先选择HGX
- 需要自定义CPU、内存、存储、网卡或机箱。
- 已有固定OEM、供应链、维保和数据中心标准。
- 希望在相同HGX计算基础上优化整机成本。
- 需要与现有服务器、网络和存储体系统一。
- 具备系统集成、固件管理和集群验收能力。
- 需要国产整机品牌或特定区域的交付与服务。
选型时需要核对哪些信息
| 检查项 | 需要确认的内容 |
|---|---|
| GPU平台 | H100、H200、B200或其他代际,GPU数量与功率配置 |
| CPU与内存 | 型号、核心数、内存容量、内存速度与NUMA |
| 节点互联 | NVLink代际、NVSwitch数量与Fabric Manager要求 |
| 网络 | InfiniBand或以太网、端口数量、速率与GPU Direct |
| 本地存储 | 系统盘、缓存盘、RAID和检查点写入能力 |
| 共享存储 | 单节点吞吐、并发和存储网络设计 |
| 机房条件 | 机柜功率、风冷或液冷、承重和布线 |
| 软件 | OS、驱动、CUDA、NCCL、容器和调度平台 |
| 支持 | NVIDIA、OEM、集成商的责任边界和响应时效 |
| 验收 | 单卡、NVLink/NVSwitch、网络、存储、模型和稳定性测试 |
常见误区
- 误区一:HGX就是一台固定型号服务器。实际上HGX是平台,最终整机由OEM定义。
- 误区二:DGX一定比同GPU的HGX快。真实差异取决于完整配置和软件调优。
- 误区三:HGX没有NVIDIA软件。HGX服务器同样可以部署CUDA和NVIDIA AI Enterprise,但授权与支持方式不同。
- 误区四:买到八张SXM GPU就能自行组装HGX。HGX需要专用基板、NVSwitch、供电、管理和认证服务器设计。
- 误区五:DGX只是一台服务器。DGX还包括软件、支持和面向集群扩展的参考架构。
项目交付边界
赋创主要面向AI服务器整机、集群和生产环境交付。对于DGX项目,可围绕原厂系统、网络、存储和部署条件进行评估;对于HGX项目,可结合具体OEM平台、CPU、内存、网络、存储和机房条件提供整机配置与集群方案建议。
DGX和HGX的供货状态、型号配置及支持政策会随代际和区域变化,具体项目应以当前NVIDIA、OEM和授权渠道资料为准。
常见问题
HGX是一台完整服务器吗
HGX首先是GPU计算平台或基板,最终完整服务器需要由OEM加入CPU、内存、存储、网络、机箱和散热。
DGX内部是否使用HGX
多代DGX八卡系统采用与对应HGX平台一致或紧密相关的GPU、NVLink和NVSwitch计算基础,但DGX还增加完整整机配置、软件和支持体系。
DGX和HGX可以使用相同的GPU吗
可以。例如DGX H200和HGX H200服务器都可以采用8张H200,但CPU、存储、网络、系统软件和支持模式可能不同。
同样是8张H200,DGX一定更快吗
不一定。节点内GPU能力可以接近,实际性能还取决于CPU、内存、网卡、存储、功率、散热和软件版本。
HGX服务器是否可以使用NVIDIA AI Enterprise
可以,但需要核对服务器认证、GPU型号、部署方式和相应的软件订阅与支持矩阵。
DGX更适合单机还是集群
两者都适合。DGX可单机使用,也可以按照BasePOD或SuperPOD参考架构扩展为集群。
HGX和普通PCIe多卡服务器有什么区别
HGX通常采用SXM GPU、NVLink和NVSwitch构建高速节点内互联;普通PCIe多卡服务器主要通过PCIe通信,配置更灵活但节点内互联能力不同。
选择HGX是否一定更便宜
不一定。HGX具有更大的配置和供应商选择空间,但最终成本取决于CPU、内存、网络、存储、散热、软件、维保和集成服务。
方案咨询
需要把方案落到实际配置?
联系赋创获取算力、软件栈和交付路径建议。