AI硬件 服务器

NVIDIA HGX

NVIDIA HGX 是面向服务器厂商和数据中心系统的 GPU 基板平台,常作为 4-GPU、8-GPU 训练服务器和高端 AI 节点的底层平台。

hardwareservernvidiahgxmulti-gpuai-training
Slug
nvidia-hgx
更新
2026-05-03
来源
3
关系
5

概览

NVIDIA HGX 是 NVIDIA 面向数据中心服务器厂商的 GPU 基板平台。很多 4-GPU、8-GPU AI 服务器并不是从零设计 GPU 拓扑,而是基于 HGX 平台构建整机。

在 赋创 中,HGX 应作为理解高端训练服务器、GPU 拓扑、NVLink / NVSwitch、机箱散热和节点网络的核心条目。

官方可确认的信息

NVIDIA 官方 HGX 页面将 HGX 定位为面向 AI 和 HPC 的加速平台。NVIDIA H100、H200、B200 等 GPU 代际都可以在对应的 HGX 平台中出现。官方资料也明确将 HGX 与 NVLink / NVSwitch、多 GPU 系统和数据中心服务器平台联系起来。

这些信息说明:HGX 不是单张 GPU,而是服务器内部 GPU 子系统平台。

HGX 解决什么问题

1. 标准化多 GPU 基板

HGX 提供了 GPU、NVLink / NVSwitch、供电和散热相关的基础平台,便于 OEM 厂商构建训练服务器。

2. 训练节点拓扑

8-GPU HGX 节点通常用于大模型训练、微调和高吞吐推理,是企业训练集群里的常见高端节点形态。

3. 与整机厂商的关系

HGX 是底层平台,最终服务器仍由 OEM / ODM 厂商设计机箱、CPU、内存、网卡、存储、散热和管理系统。

与 DGX 的关系

HGX 更像平台和基板,DGX 更像 NVIDIA 自有整机系统。很多企业采购会在“基于 HGX 的 OEM 服务器”和“DGX 系统”之间做选择。

选型边界

  • 需要高端训练节点、GPU 间高带宽互联和标准化多 GPU 拓扑时,优先评估 HGX / DGX 级平台。
  • 只做单模型多副本推理、视频分析或中小模型服务时,普通 PCIe 多 GPU 服务器可能更经济。
  • 采购 HGX 服务器时,仍需单独确认整机厂商的 CPU、内存、网卡、存储、散热、BMC、维保和机柜适配。

工程估算说明

以下不是官方固定配置,而是服务器选型口径:

  • 如果目标是大模型训练,HGX 8-GPU 节点通常比普通 PCIe 多卡服务器更适合;
  • 如果目标是单模型多副本推理,HGX 不一定是成本最优;
  • 选型时要同时看 GPU 代际、GPU 数量、NVSwitch、网卡、CPU、内存、供电、散热和机柜能力;
  • HGX 节点常常需要配合 InfiniBand、Slurm、NCCL 和高速存储形成训练集群。

后续可补充

  • 补充 HGX H100 / H200 / B200 平台差异
  • 补充 HGX 与 OEM 服务器的采购边界
  • 补充 HGX 与 DGX 的运维差异

配置建议

不确定该硬件是否适合您的模型?

结合模型规模、显存、并发和机房条件,判断 GPU 服务器与集群配置。

获取配置建议查看赋创产品