指南 指南

训练服务器选型指南

面向大模型训练、微调和科研计算,梳理训练服务器在 GPU、NVLink/NVSwitch、InfiniBand、CPU、存储、供电散热和调度系统上的选型方法。

guidetrainingserver8-gpuhgxdgxslurmnccl
Slug
guide-training-server-sizing
更新
2026-04-26
来源
4
关系
5

概览

训练服务器选型不能只看 GPU 型号,而要从训练任务反推 GPU 显存、互联方式、节点网络、存储吞吐、调度系统和机房条件。LoRA / QLoRA 微调、中大型全参数微调、预训练 / 多节点训练,对服务器架构的要求完全不同。

适用对象与不适用对象

适用场景

  • 基于 LoRA / QLoRA 的轻量微调
  • 全参数微调(SFT、DPO)
  • 多模态模型训练
  • 科研计算(非生产级)
  • 7B~70B 参数范围的预训练

不适用或不推荐场景

  • 纯推理场景(推理服务器选型需另见推理指南)
  • 单卡即可满足的简单模型训练(无需考虑多卡互联)
  • 已有固定硬件品牌/平台要求,无需整体架构评估
  • 无机房条件(供电、散热、网络端口)限制的临时项目

需求判断框架

训练类型典型特征关键判断维度
小规模微调单机单卡或2~4卡,LoRA/QLoRA,7B以下模型显存容量、框架支持(Hugging Face等)、数据 I/O 带宽
中大型模型微调单机8卡或双机,全参数微调,30B~70BGPU 互联(NVLink/NVSwitch)、NCCL 多卡通信、Checkpoint 存储吞吐、训练稳定性
预训练 / 大规模训练多节点集群(≥4节点),70B~数百B8-GPU 节点形态、InfiniBand 或高规格 RoCE 网络、Slurm 作业调度、分布式存储、液冷散热、机房供电

判断流程:先确定当前项目属于哪一类型 → 评估并发任务数和训练周期 → 反推 GPU 代际、互联和网络规格。

关键技术与配置维度

GPU 代际

  • A100(40GB / 80GB):适合中大规模训练,NVLink 600GB/s,成熟生态
  • H100(80GB / 94GB?【待核验:H100显存规格以NVIDIA官方为准】):Transformer Engine 加速,支持 FP8,适合预训练
  • H200(141GB):更高显存,适合长上下文或大 batch 训练
  • B200:属于 Blackwell 代际,适合放在面向更高密度训练与推理的下一代平台中讨论;具体是否适合当前项目,需要结合供应、预算、功耗、软件栈和集群规划综合判断。

选型方向:小规模微调可选用 A100 或 H100 单机;预训练优先 H100 或 H200 集群。

GPU 互联

  • 单机内:NVLink(A100/H100:600GB/s 或 900GB/s,需核对具体代际规格【待核验】),NVSwitch 实现全互联
  • 跨节点:需通过 InfiniBand(NDR200/400)或 RoCE v2(25/100GbE)实现 GPU Direct RDMA

影响:张量并行、流水线并行依赖高带宽互联;数据并行对网络带宽要求相对较低。

节点网络

  • 多节点训练必须评估:NCCL 通信带宽、网络拓扑(Fat-Tree / Dragonfly)、RoCE 的 PFC 和 ECN 配置
  • 至少需要每节点 8× 100GbE 或 4× 200Gb InfiniBand(具体取决于训练框架和模型规模【待核验】)

存储

  • 训练数据集与 Checkpoint 读写不能成为 GPU 空闲的原因
  • 推荐分布式并行文件系统(如 Lustre、GPFS、BeeGFS),带宽不低于每节点 10~20GB/s(小规模可降低)
  • 关键指标:IOPS、带宽、元数据处理能力

调度系统

  • Slurm:适合作业队列、共享集群、GPU 资源调度,典型训练环境首选
  • Kubernetes:适合推理或微服务化训练(MPS、 Volcano 等),但生产级训练仍以 Slurm 为主
  • 若需要混合部署(训练+推理),可评估 Slurm + Kubernetes 共存方案

散热与供电

  • 高密度 8-GPU 节点(如 HGX 8× H100)单机功耗可达 5~10kW
  • 需前置评估机柜散热能力:风冷上限约 15~20kW/机柜,超出需液冷
  • 供电需配置冗余 UPS 和 PDU(每路 30~60A)

分阶段实施路径

阶段一:验证评估

  • 确定训练类型、模型规模、预计数据集大小和训练周期
  • 使用小规模 GPU(如单卡 A100)测试模型兼容性和数据加载流程
  • 评估是否需要多卡并行或分布式训练框架

阶段二:架构设计

  • 根据验证结果选择 GPU 代际和节点数量
  • 设计网络拓扑(InfiniBand 或 RoCE)和存储方案
  • 评估调度系统(Slurm 优先)和作业管理策略

阶段三:硬件部署

  • 按设计方案采购服务器、网络交换机和存储节点
  • 确认机房供电(每节点功耗、总功率、机柜容量)、散热(风冷或液冷)、网络端口(光纤/网线类型)
  • 部署厂商提供的出厂验证(需在合同中明确验收标准)

阶段四:环境搭建

  • 安装 GPU 驱动、CUDA 和 NCCL 库(版本需兼容)
  • 配置网络(InfiniBand/RoCE)并测试 RDMA 连接
  • 部署调度系统(Slurm)和存储挂载
  • 跑通分布式训练基准(如 NCCL Tester、Llama 2 参考训练脚本)

阶段五:联调与验收

  • 执行多节点训练任务,监控 GPU 利用率、NCCL 通信效率、存储 I/O
  • 验证 Checkpoint 保存/恢复的正确性
  • 达到项目要求的吞吐和稳定性指标(见验收标准)

配置或架构方向

以下为典型场景的配置评价方向,非固定采购清单,实际配置需结合模型、数据、预算和机房条件测试

场景配置方向说明
小规模微调(LoRA)单机 4× A100 80GB 或 H100 80GB,无需 NVSwitch,RoCE 网络(25GbE 可选)重点在显存和数据 I/O
中大规模微调(全参数)单机 8× H100 80GB,NVLink + NVSwitch,InfiniBand NDR200 或 RoCE 100GbE,NVMe 本地存储 + NFS 共享需要高带宽互联和高速 Checkpoint 写入
预训练(70B 级)8-GPU 节点(HGX 或 DGX),InfiniBand NDR400 多节点,分布式并行文件系统,Slurm 调度,液冷(节点功耗 > 5kW 时必选)集群规模通常 4~16 节点

风险与避坑清单

  1. 忽略 GPU 互联:购买 8 张独立 GPU 但无 NVLink,张量并行性能损失可达 30~50%。
  2. 网络带宽不足:多节点训练使用 10GbE 以太网,NCCL 通信成为瓶颈,GPU 利用率低。
  3. 存储成为瓶颈:使用单机盘阵,Checkpoint 写入几十分钟,GPU 闲置。
  4. 忽略机房限制:服务器到货后才发现机柜功率或散热不足,无法上架。
  5. 调度系统选择错误:用 Kubernetes 做大规模预训练,作业管理和资源隔离不如 Slurm。
  6. 过度追求单机 GPU 数量:8 卡单机无法满足显存和算力需求时,应尽早规划多节点。
  7. 低估运维复杂性:训练集群需要专职运维工程师,否则故障恢复慢。

验收标准

训练服务器交付前应至少完成以下验证:

  • 基础硬件验收:服务器启动、GPU 识别、BIOS 设置符合要求
  • GPU 功能测试:所有 GPU 可运行 CUDA 示例,显存无坏块(可使用 nvidia-smimemtest
  • NCCL 通信测试:单机内 allreduce 带宽达到 NVLink 规格的 90% 以上;多节点间达到网络峰值 80% 以上
  • 存储读写测试:数据集加载速度与 Checkpoint 保存速度满足训练需求(测试成果【待核验】)
  • 训练稳定性测试:持续运行 24 小时以上无 GPU 掉线、无进程崩溃、GPU 利用率波动可控(负载不超 90%)
  • 散热测试:满载 30 分钟后 GPU 温度不超规格(A100/H100 通常 ≤ 85°C)
以上测试标准和阈值需在合同中明确,建议由厂商现场执行并出具报告。

后续扩展建议

  • 从单机到多机:先验证 2 节点训练集群,再扩展至 4~8 节点
  • 从微调到预训练:逐步升级 GPU 代际,增加 InfiniBand 网络和并行存储
  • 从训练到推理:可复用部分节点(需重新配置调度和网络),建议单独规划推理集群
  • 国产算力替代:如需信创适配,可评估华为昇腾、寒武纪等芯片,需额外关注通信库兼容性

选型支持

需要基于实际项目做选型判断?

结合模型、数据、预算和机房条件,形成更具体的采购与部署建议。

获取选型建议查看 AI 解决方案