NVIDIA HGX
NVIDIA HGX 是面向服务器厂商和数据中心系统的 GPU 基板平台,常作为 4-GPU、8-GPU 训练服务器和高端 AI 节点的底层平台。
hardwareservernvidiahgxmulti-gpuai-training
- Slug
nvidia-hgx- 更新
- 2026-05-03
- 来源
- 3
- 关系
- 5
概览
NVIDIA HGX 是 NVIDIA 面向数据中心服务器厂商的 GPU 基板平台。很多 4-GPU、8-GPU AI 服务器并不是从零设计 GPU 拓扑,而是基于 HGX 平台构建整机。
在 赋创 中,HGX 应作为理解高端训练服务器、GPU 拓扑、NVLink / NVSwitch、机箱散热和节点网络的核心条目。
官方可确认的信息
NVIDIA 官方 HGX 页面将 HGX 定位为面向 AI 和 HPC 的加速平台。NVIDIA H100、H200、B200 等 GPU 代际都可以在对应的 HGX 平台中出现。官方资料也明确将 HGX 与 NVLink / NVSwitch、多 GPU 系统和数据中心服务器平台联系起来。
这些信息说明:HGX 不是单张 GPU,而是服务器内部 GPU 子系统平台。
HGX 解决什么问题
1. 标准化多 GPU 基板
HGX 提供了 GPU、NVLink / NVSwitch、供电和散热相关的基础平台,便于 OEM 厂商构建训练服务器。
2. 训练节点拓扑
8-GPU HGX 节点通常用于大模型训练、微调和高吞吐推理,是企业训练集群里的常见高端节点形态。
3. 与整机厂商的关系
HGX 是底层平台,最终服务器仍由 OEM / ODM 厂商设计机箱、CPU、内存、网卡、存储、散热和管理系统。
与 DGX 的关系
HGX 更像平台和基板,DGX 更像 NVIDIA 自有整机系统。很多企业采购会在“基于 HGX 的 OEM 服务器”和“DGX 系统”之间做选择。
选型边界
- 需要高端训练节点、GPU 间高带宽互联和标准化多 GPU 拓扑时,优先评估 HGX / DGX 级平台。
- 只做单模型多副本推理、视频分析或中小模型服务时,普通 PCIe 多 GPU 服务器可能更经济。
- 采购 HGX 服务器时,仍需单独确认整机厂商的 CPU、内存、网卡、存储、散热、BMC、维保和机柜适配。
工程估算说明
以下不是官方固定配置,而是服务器选型口径:
- 如果目标是大模型训练,HGX 8-GPU 节点通常比普通 PCIe 多卡服务器更适合;
- 如果目标是单模型多副本推理,HGX 不一定是成本最优;
- 选型时要同时看 GPU 代际、GPU 数量、NVSwitch、网卡、CPU、内存、供电、散热和机柜能力;
- HGX 节点常常需要配合 InfiniBand、Slurm、NCCL 和高速存储形成训练集群。
后续可补充
- 补充 HGX H100 / H200 / B200 平台差异
- 补充 HGX 与 OEM 服务器的采购边界
- 补充 HGX 与 DGX 的运维差异
配置建议
不确定该硬件是否适合您的模型?
结合模型规模、显存、并发和机房条件,判断 GPU 服务器与集群配置。