NVIDIA H100
NVIDIAH100是基于Hopper架构的数据中心GPU,面向大模型训练、高吞吐推理和HPC。选型时必须区分SXM与NVL/PCIe形态,并同时评估显存、互联、服务器平台和软件版本。
- Slug
nvidia-h100- 更新
- 2026-07-02
- 来源
- 2
- 关系
- 3
概览
NVIDIA H100 是基于 Hopper 架构的数据中心 GPU,面向大模型训练、高吞吐推理和 HPC。选型时必须区分 SXM 与 NVL/PCIe 形态,并同时评估显存、互联、服务器平台和软件版本。
产品定位
- 核心定位:数据中心级训练、推理与科学计算。
- 主要优势:Transformer Engine、FP8、NVLink/NVSwitch 和成熟 CUDA 生态。
- 适用客户:需要多卡训练、规模化推理、虚拟化或 HPC 的企业与科研机构。
核心参数规格
| 参数 | H100 SXM | H100 NVL |
|---|---|---|
| 架构 | Hopper | Hopper |
| 显存 | 80GB HBM3 | 94GB HBM3 |
| 显存带宽 | 3.35TB/s | 3.9TB/s |
| 互联 | NVLink 900GB/s | NVLink 600GB/s |
| 最大功耗 | 最高700W,可配置 | 350—400W,可配置 |
| MIG | 最多7个实例 | 最多7个实例 |
| 主要平台 | HGX/DGX H100 | PCIe 企业服务器 |
关键参数如何理解
显存容量决定模型权重、激活和 KV Cache 的基础空间,但不能单独推导模型并发。H100 NVL 的 94GB 显存更适合高显存推理,H100 SXM 则更强调多卡互联和高密度平台。
Tensor Core 峰值必须注明精度和稀疏口径。实际训练或推理性能还受模型结构、batch、并行策略、框架版本和服务器拓扑影响。
NVLink/NVSwitch 的价值主要体现在多卡通信。单卡推理或通信量较低的任务,不一定能充分利用 HGX 平台的成本。
适用任务与场景
- 多卡预训练、继续预训练和全参数微调。
- 高吞吐生产推理和多租户服务。
- FP64、张量计算和带宽敏感型 HPC。
- 不能仅凭单卡峰值算力承诺模型生产承载量。
软件生态与适配
H100 与 CUDA、NCCL、TensorRT-LLM、Triton 和 NVIDIA AI Enterprise 结合成熟,但仍需核对驱动、CUDA、容器、固件与 OEM 服务器版本。
部署关注点
- SXM 适合 HGX/DGX 高密度平台,对供电、散热和机房要求高。
- NVL 更适合标准 PCIe 服务器,但多卡互联能力与 HGX 不同。
- 不同型号节点可同池管理,但单个分布式作业通常不建议混用。
选型边界
- 适合:成熟生产环境、多卡训练、高吞吐推理和 HPC。
- 不一定适合:低并发小模型、普通工作站或预算敏感 PoC。
- 显存成为瓶颈时可评估 H200;追求新一代平台可评估 B200。
与相邻型号的选择边界
与 A100 相比,H100 增加 Transformer Engine 和 FP8 能力,更适合生成式 AI 训练与推理。
与 H200 相比,H100 的计算架构相同,但显存与带宽较低;如果显存和 KV Cache 是主要瓶颈,应优先评估 H200。
与 B200 相比,H100 的软件和服务器生态更成熟,但新一代精度与吞吐能力较弱。
进一步选型需要哪些信息
- 模型与 Dense/MoE 架构。
- 训练、微调或推理及目标精度。
- 上下文、并发、延迟与吞吐。
- GPU 数量、服务器形态和机房条件。
常见问题
H100 SXM 和 H100 NVL 怎么选?
多卡训练、强通信和高密度集群优先评估 SXM/HGX;高显存推理、标准 PCIe 服务器和较灵活扩容可评估 H100 NVL。
H100 能单卡部署 70B 模型吗?
取决于模型、精度、量化、上下文和框架。94GB H100 NVL 可作为低精度 70B 单卡推理评估方向,但生产并发和 KV Cache 仍需实测。
H100 是否适合小模型推理?
技术上可以,但低并发小模型往往无法充分利用 H100 的互联和高端特性,L40S、RTX PRO 或更低功耗推理卡可能更经济。
H100 与 H200 可以混用吗?
可以在同一集群中分区管理,但单个分布式作业通常不建议随意混用,以免显存、性能和拓扑差异造成效率下降。
配置建议
不确定该硬件是否适合您的模型?
结合模型规模、显存、并发和机房条件,判断 GPU 服务器与集群配置。