指南AI 服务器

AMD Instinct 八卡服务器配置、ROCm 与集群部署指南

AMD Instinct 八卡服务器通常采用 OAM 与 UBB 平台,部署需要同时规划 Infinity Fabric、CPU与NUMA、主机内存、400G网络、ROCm、供电散热和系统验收。本文给出可执行的节点与集群检查框架。

AMD 八卡服务器AMD Instinct 8 GPUMI300X 八卡服务器MI325X 八卡服务器MI350X 八卡服务器
Slug
amd-instinct-8-gpu-server-deployment-guide
更新
2026-07-03
来源
5
关系
2

概述

AMD Instinct 八卡服务器不是将八张普通 PCIe 加速卡插入主板,而是将 8 个 OAM 加速器集成到 UBB 底板,并通过 AMD Infinity Fabric 建立 GPU 间通信。完整部署需要同时处理 CPU 与 NUMA、主机内存、PCIe 拓扑、高速网卡、存储、ROCm、固件、供电散热和验收测试。

MI300X、MI325X、MI350X 和 MI355X 虽然都可采用八卡平台,但显存、功耗、ROCm 要求和散热条件不同。项目应以具体 OEM 整机的 BKC、兼容矩阵和验收基线为准,不能把某一型号的推荐配置直接套用到全部平台。

八卡平台的基本架构

AMD Instinct 主力数据中心型号通常采用 OCP Accelerator Module,即 OAM。8 个 OAM 安装在 Universal Baseboard,即 UBB 上,由底板提供 54V 供电、GPU 互联和主机接口。服务器主板再通过 PCIe 将 GPU 底板、CPU、网卡和存储连接起来。

组件主要作用部署关注点
8个OAM GPU提供AI与HPC计算及HBM显存型号、功耗、固件和散热方式必须一致
UBB底板提供GPU供电和Infinity Fabric互联版本、拓扑和OEM认证不可随意替换
双路服务器CPU数据预处理、主机内存和I/O管理核心数、内存通道、PCIe通道与NUMA
主机内存数据缓存、CPU卸载、容器与虚拟化容量、带宽和每Socket均衡
后端高速NIC多节点GPU通信RoCE/InfiniBand、RDMA、GPU Direct和拓扑
前端与管理网络业务访问、存储和运维与训练网络隔离并设计冗余
NVMe存储模型、数据集和本地缓存吞吐、容量、RAID及NUMA位置
BMC与监控远程管理、告警和固件维护独立管理网络、权限和日志留存

不同型号的八卡平台差异

型号单卡显存八卡总显存单卡功耗口径主要部署特点
MI300X192GB HBM3约1.5TB750W级CDNA 3成熟八卡平台
MI325X256GB HBM3E2TB最高1000W更大显存和6TB/s带宽
MI350X288GB HBM3E约2.3TB1000WCDNA 4、UBB 2.0与新低精度能力
MI355X288GB HBM3E约2.3TB1400W高密度持续性能和液冷基础设施

表中功耗仅为 GPU 模块口径,整机功耗还包括 CPU、内存、网卡、存储、风扇或泵。不同 OEM 服务器可能采用不同功率限制和冷却方案。

Infinity Fabric 与 GPU 拓扑

八卡节点内的 GPU 通信依赖 AMD Infinity Fabric。对于训练、MoE 和模型并行,卡间带宽和拓扑直接影响 all-reduce、all-gather、reduce-scatter 和 all-to-all 性能。部署前需要取得 OEM 拓扑图,并使用系统工具验证 GPU 之间的 P2P 路径。

  • 确认8张GPU均被操作系统和ROCm正确识别。
  • 验证GPU之间的P2P访问和带宽是否符合平台基线。
  • 检查GPU是否经过预期的PCIe Switch和Infinity Fabric路径。
  • 不要把8张GPU显存理解为自动形成透明统一显存池。
  • 模型并行效率需通过RCCL和真实框架测试确认。

CPU、PCIe与NUMA规划

典型八卡服务器采用双路服务器 CPU。每张 GPU、NIC 和 NVMe 设备都挂接在特定 CPU 或 PCIe Switch 下。若训练进程、数据加载线程和网卡绑定错误,数据可能跨 Socket 绕行,造成延迟上升和带宽下降。

NUMA检查重点

  • 绘制CPU、GPU、NIC、NVMe和PCIe Switch的完整拓扑。
  • 将进程和CPU线程绑定到靠近目标GPU的NUMA节点。
  • 将后端NIC与对应GPU组尽量放在同一NUMA域。
  • 确认内存通道均衡安装,避免单Socket内存带宽不足。
  • 测试本地与跨NUMA的PCIe、内存和网络性能差异。

主机内存如何配置

主机内存不仅用于操作系统,还承担数据预处理、CPU卸载、文件缓存、容器、数据加载和虚拟化。AMD 当前验收指南对典型八卡平台给出的高层参考如下:

GPU型号无虚拟化或单虚拟机参考多虚拟机参考
MI300X2TB3TB
MI325X2.5TB6TB
MI350X3TB6TB
MI355X3TB6TB

这些数值是 AMD 验收文档中的平台参考,不是所有业务的硬性最低值。推理节点、训练节点、CPU 卸载和多租户平台的内存需求不同,最终配置应根据工作负载测算并与 OEM 确认。

多节点网络怎么设计

单节点内使用 Infinity Fabric,多节点之间通常通过 RoCE 或 InfiniBand 进行 scale-out。网络设计需要同时考虑每节点 NIC 数量、单端口速率、交换机无阻塞能力、RDMA、拥塞控制和作业规模。

  • 速率:AMD通用前提指南给出100—400GbE或InfiniBand范围;MI350X高层验收示例采用8张400G后端NIC。
  • RoCE:需要配置PFC、ECN、DCQCN或相应拥塞控制,并验证无损网络。
  • InfiniBand:需要核对HCA、交换机、子网管理器、固件和路由。
  • RDMA:确认网卡、驱动、IOMMU、GPU Direct和内存注册工作正常。
  • 拓扑:NIC与GPU分组需要和NUMA位置对应。
  • 测试:先测主机网络,再测GPU Direct RDMA,最后测RCCL集合通信。

存储与数据供给

大规模训练和推理不仅消耗 GPU 算力,也依赖模型加载、数据集读取、检查点保存和日志写入。存储不足会导致 GPU 等待数据,掩盖真实计算能力。

  • 系统盘与训练数据盘分离,系统盘建议做冗余。
  • 使用本地NVMe作为模型和数据集缓存,并确认PCIe拓扑。
  • 多节点训练需要评估并行文件系统或对象存储吞吐。
  • 检查点写入应避免占满后端训练网络。
  • 根据数据集大小、epoch、检查点频率和保留策略规划容量。

供电与散热

八卡平台的功率密度很高。MI350X 仅 GPU 模块约 8kW,MI355X 仅 GPU 模块约 11.2kW。整机功耗必须以 OEM 规格为准,不能简单用 GPU 功耗相加后作为机房设计值。

  • 确认机柜PDU、母线、电源输入制式和A/B路冗余。
  • 确认服务器最大输入功率、启动浪涌和功率限制策略。
  • 风冷平台核对CFM、冷热通道和机柜密度。
  • 液冷平台核对CDU、流量、温度、压力、水质和漏液检测。
  • 在持续满载下记录GPU温度、功耗、频率和降频情况。

ROCm与系统软件

ROCm 部署应采用服务器厂商验证的操作系统、内核、GPU 驱动、ROCm 和固件组合。不要只安装最新版本,也不要将单个组件独立升级到未验证版本。

  • 固定OS、内核、BIOS、BMC、PCIe Switch、NIC和GPU固件。
  • 安装与GPU型号匹配的ROCm版本。
  • 使用容器固化PyTorch、vLLM、SGLang或HPC应用环境。
  • 检查RCCL、MIOpen、rocBLAS和其他数学库版本。
  • 配置监控、日志、故障收集和版本回退方案。
  • 升级前运行完整正确性、性能和稳定性回归。

验收流程应该覆盖什么

AMD 官方客户验收指南将验收分为节点验证和集群网络验证。建议按以下顺序执行:

  1. 前提检查:OEM兼容性、OS、内核参数、固件、ROCm和依赖。
  2. 基础健康:GPU识别、驱动日志、显存、温度、功耗和错误状态。
  3. 单卡基准:计算、HBM带宽和稳定性。
  4. 节点互联:P2P、PCIe、Infinity Fabric和RCCL。
  5. 持续压力:满负载运行并观察温度、频率、错误和液冷状态。
  6. 网络基准:链路、RDMA、GPU Direct和跨节点集合通信。
  7. 工作负载:使用目标模型或HPC应用验证吞吐、延迟、显存和扩展效率。
  8. 基线留档:保存版本、拓扑、配置、测试结果和告警阈值。

常见部署误区

  • 只看GPU参数,不核对OEM整机和UBB版本。
  • 将八卡总显存理解为所有程序都能自动使用。
  • 忽略CPU、NUMA和NIC亲和性。
  • 按普通以太网方式部署RoCE,未配置拥塞控制。
  • 只做单卡跑分,不测试RCCL和跨节点通信。
  • 使用未锁定版本的ROCm和容器,导致环境漂移。
  • 只按平均功耗设计机房,未考虑持续峰值和冗余。
  • 没有使用真实模型进行最终验收。

项目规划前需要哪些信息

  • GPU型号、节点数量和未来扩展规模。
  • 模型、框架、精度、并行策略和自定义算子。
  • 训练、推理、HPC或混合业务。
  • 目标吞吐、延迟、训练周期和可用性。
  • 机房功率、散热、网络、存储和机柜条件。
  • ROCm迁移工作量和团队运维能力。
  • OEM平台、供货渠道、保修和技术支持。

AMD八卡平台在国内的实际供货和项目数量相对有限。赋创可结合项目需求协助进行服务器架构、网络、软件栈与验收方案评估,具体产品和交付条件以项目确认结果为准。

常见问题

AMD八卡服务器是八张PCIe卡吗?

通常不是。MI300X至MI355X主力平台采用8个OAM和UBB底板,结构、供电和互联与普通PCIe多卡服务器不同。

八张AMD GPU的显存能直接合并吗?

不能自动形成透明统一显存池,需要模型并行、数据并行或框架切分,并承担通信开销。

AMD八卡服务器一定需要3TB内存吗?

不同型号不同。AMD验收指南对MI350X和MI355X给出3TB级参考,但最终应按工作负载和OEM平台确定。

多节点应该用RoCE还是InfiniBand?

两者均可,需结合现有网络、规模、运维能力和应用通信模式选择,并完成RDMA与RCCL测试。

只安装ROCm就能运行CUDA应用吗?

不能。框架、依赖库、自定义算子和容器都需要检查,部分CUDA代码需要HIP迁移。

八卡服务器验收只跑模型够吗?

不够。还要验证固件、硬件健康、显存、P2P、RCCL、RDMA、温度、功耗和持续稳定性。

MI355X八卡平台可以部署在普通机房吗?

通常需要高功率配电和液冷基础设施,必须先完成机柜、CDU、供回液和运维条件评估。

方案咨询

需要把方案落到实际配置?

联系赋创获取算力、软件栈和交付路径建议。

咨询方案浏览指南