AI硬件 GPU

NVIDIA H100

NVIDIAH100是基于Hopper架构的数据中心GPU,面向大模型训练、高吞吐推理和HPC。选型时必须区分SXM与NVL/PCIe形态,并同时评估显存、互联、服务器平台和软件版本。

gpuai-trainingai-inferencehbm3nvlinkcudahopperH100 GPUH100 SXMH100 NVL
Slug
nvidia-h100
更新
2026-07-02
来源
2
关系
3

概览

NVIDIA H100 是基于 Hopper 架构的数据中心 GPU,面向大模型训练、高吞吐推理和 HPC。选型时必须区分 SXM 与 NVL/PCIe 形态,并同时评估显存、互联、服务器平台和软件版本。

产品定位

  • 核心定位:数据中心级训练、推理与科学计算。
  • 主要优势:Transformer Engine、FP8、NVLink/NVSwitch 和成熟 CUDA 生态。
  • 适用客户:需要多卡训练、规模化推理、虚拟化或 HPC 的企业与科研机构。

核心参数规格

参数H100 SXMH100 NVL
架构HopperHopper
显存80GB HBM394GB HBM3
显存带宽3.35TB/s3.9TB/s
互联NVLink 900GB/sNVLink 600GB/s
最大功耗最高700W,可配置350—400W,可配置
MIG最多7个实例最多7个实例
主要平台HGX/DGX H100PCIe 企业服务器

关键参数如何理解

显存容量决定模型权重、激活和 KV Cache 的基础空间,但不能单独推导模型并发。H100 NVL 的 94GB 显存更适合高显存推理,H100 SXM 则更强调多卡互联和高密度平台。

Tensor Core 峰值必须注明精度和稀疏口径。实际训练或推理性能还受模型结构、batch、并行策略、框架版本和服务器拓扑影响。

NVLink/NVSwitch 的价值主要体现在多卡通信。单卡推理或通信量较低的任务,不一定能充分利用 HGX 平台的成本。

适用任务与场景

  • 多卡预训练、继续预训练和全参数微调。
  • 高吞吐生产推理和多租户服务。
  • FP64、张量计算和带宽敏感型 HPC。
  • 不能仅凭单卡峰值算力承诺模型生产承载量。

软件生态与适配

H100 与 CUDA、NCCL、TensorRT-LLM、Triton 和 NVIDIA AI Enterprise 结合成熟,但仍需核对驱动、CUDA、容器、固件与 OEM 服务器版本。

部署关注点

  • SXM 适合 HGX/DGX 高密度平台,对供电、散热和机房要求高。
  • NVL 更适合标准 PCIe 服务器,但多卡互联能力与 HGX 不同。
  • 不同型号节点可同池管理,但单个分布式作业通常不建议混用。

选型边界

  • 适合:成熟生产环境、多卡训练、高吞吐推理和 HPC。
  • 不一定适合:低并发小模型、普通工作站或预算敏感 PoC。
  • 显存成为瓶颈时可评估 H200;追求新一代平台可评估 B200。

与相邻型号的选择边界

与 A100 相比,H100 增加 Transformer Engine 和 FP8 能力,更适合生成式 AI 训练与推理。

与 H200 相比,H100 的计算架构相同,但显存与带宽较低;如果显存和 KV Cache 是主要瓶颈,应优先评估 H200。

与 B200 相比,H100 的软件和服务器生态更成熟,但新一代精度与吞吐能力较弱。

进一步选型需要哪些信息

  • 模型与 Dense/MoE 架构。
  • 训练、微调或推理及目标精度。
  • 上下文、并发、延迟与吞吐。
  • GPU 数量、服务器形态和机房条件。

常见问题

H100 SXM 和 H100 NVL 怎么选?

多卡训练、强通信和高密度集群优先评估 SXM/HGX;高显存推理、标准 PCIe 服务器和较灵活扩容可评估 H100 NVL。

H100 能单卡部署 70B 模型吗?

取决于模型、精度、量化、上下文和框架。94GB H100 NVL 可作为低精度 70B 单卡推理评估方向,但生产并发和 KV Cache 仍需实测。

H100 是否适合小模型推理?

技术上可以,但低并发小模型往往无法充分利用 H100 的互联和高端特性,L40S、RTX PRO 或更低功耗推理卡可能更经济。

H100 与 H200 可以混用吗?

可以在同一集群中分区管理,但单个分布式作业通常不建议随意混用,以免显存、性能和拓扑差异造成效率下降。

配置建议

不确定该硬件是否适合您的模型?

结合模型规模、显存、并发和机房条件,判断 GPU 服务器与集群配置。

获取配置建议查看赋创产品