AMD Instinct 八卡服务器配置、ROCm 与集群部署指南
AMD Instinct 八卡服务器通常采用 OAM 与 UBB 平台,部署需要同时规划 Infinity Fabric、CPU与NUMA、主机内存、400G网络、ROCm、供电散热和系统验收。本文给出可执行的节点与集群检查框架。
- Slug
amd-instinct-8-gpu-server-deployment-guide- 更新
- 2026-07-03
- 来源
- 5
- 关系
- 2
概述
AMD Instinct 八卡服务器不是将八张普通 PCIe 加速卡插入主板,而是将 8 个 OAM 加速器集成到 UBB 底板,并通过 AMD Infinity Fabric 建立 GPU 间通信。完整部署需要同时处理 CPU 与 NUMA、主机内存、PCIe 拓扑、高速网卡、存储、ROCm、固件、供电散热和验收测试。
MI300X、MI325X、MI350X 和 MI355X 虽然都可采用八卡平台,但显存、功耗、ROCm 要求和散热条件不同。项目应以具体 OEM 整机的 BKC、兼容矩阵和验收基线为准,不能把某一型号的推荐配置直接套用到全部平台。
八卡平台的基本架构
AMD Instinct 主力数据中心型号通常采用 OCP Accelerator Module,即 OAM。8 个 OAM 安装在 Universal Baseboard,即 UBB 上,由底板提供 54V 供电、GPU 互联和主机接口。服务器主板再通过 PCIe 将 GPU 底板、CPU、网卡和存储连接起来。
| 组件 | 主要作用 | 部署关注点 |
|---|---|---|
| 8个OAM GPU | 提供AI与HPC计算及HBM显存 | 型号、功耗、固件和散热方式必须一致 |
| UBB底板 | 提供GPU供电和Infinity Fabric互联 | 版本、拓扑和OEM认证不可随意替换 |
| 双路服务器CPU | 数据预处理、主机内存和I/O管理 | 核心数、内存通道、PCIe通道与NUMA |
| 主机内存 | 数据缓存、CPU卸载、容器与虚拟化 | 容量、带宽和每Socket均衡 |
| 后端高速NIC | 多节点GPU通信 | RoCE/InfiniBand、RDMA、GPU Direct和拓扑 |
| 前端与管理网络 | 业务访问、存储和运维 | 与训练网络隔离并设计冗余 |
| NVMe存储 | 模型、数据集和本地缓存 | 吞吐、容量、RAID及NUMA位置 |
| BMC与监控 | 远程管理、告警和固件维护 | 独立管理网络、权限和日志留存 |
不同型号的八卡平台差异
| 型号 | 单卡显存 | 八卡总显存 | 单卡功耗口径 | 主要部署特点 |
|---|---|---|---|---|
| MI300X | 192GB HBM3 | 约1.5TB | 750W级 | CDNA 3成熟八卡平台 |
| MI325X | 256GB HBM3E | 2TB | 最高1000W | 更大显存和6TB/s带宽 |
| MI350X | 288GB HBM3E | 约2.3TB | 1000W | CDNA 4、UBB 2.0与新低精度能力 |
| MI355X | 288GB HBM3E | 约2.3TB | 1400W | 高密度持续性能和液冷基础设施 |
表中功耗仅为 GPU 模块口径,整机功耗还包括 CPU、内存、网卡、存储、风扇或泵。不同 OEM 服务器可能采用不同功率限制和冷却方案。
Infinity Fabric 与 GPU 拓扑
八卡节点内的 GPU 通信依赖 AMD Infinity Fabric。对于训练、MoE 和模型并行,卡间带宽和拓扑直接影响 all-reduce、all-gather、reduce-scatter 和 all-to-all 性能。部署前需要取得 OEM 拓扑图,并使用系统工具验证 GPU 之间的 P2P 路径。
- 确认8张GPU均被操作系统和ROCm正确识别。
- 验证GPU之间的P2P访问和带宽是否符合平台基线。
- 检查GPU是否经过预期的PCIe Switch和Infinity Fabric路径。
- 不要把8张GPU显存理解为自动形成透明统一显存池。
- 模型并行效率需通过RCCL和真实框架测试确认。
CPU、PCIe与NUMA规划
典型八卡服务器采用双路服务器 CPU。每张 GPU、NIC 和 NVMe 设备都挂接在特定 CPU 或 PCIe Switch 下。若训练进程、数据加载线程和网卡绑定错误,数据可能跨 Socket 绕行,造成延迟上升和带宽下降。
NUMA检查重点
- 绘制CPU、GPU、NIC、NVMe和PCIe Switch的完整拓扑。
- 将进程和CPU线程绑定到靠近目标GPU的NUMA节点。
- 将后端NIC与对应GPU组尽量放在同一NUMA域。
- 确认内存通道均衡安装,避免单Socket内存带宽不足。
- 测试本地与跨NUMA的PCIe、内存和网络性能差异。
主机内存如何配置
主机内存不仅用于操作系统,还承担数据预处理、CPU卸载、文件缓存、容器、数据加载和虚拟化。AMD 当前验收指南对典型八卡平台给出的高层参考如下:
| GPU型号 | 无虚拟化或单虚拟机参考 | 多虚拟机参考 |
|---|---|---|
| MI300X | 2TB | 3TB |
| MI325X | 2.5TB | 6TB |
| MI350X | 3TB | 6TB |
| MI355X | 3TB | 6TB |
这些数值是 AMD 验收文档中的平台参考,不是所有业务的硬性最低值。推理节点、训练节点、CPU 卸载和多租户平台的内存需求不同,最终配置应根据工作负载测算并与 OEM 确认。
多节点网络怎么设计
单节点内使用 Infinity Fabric,多节点之间通常通过 RoCE 或 InfiniBand 进行 scale-out。网络设计需要同时考虑每节点 NIC 数量、单端口速率、交换机无阻塞能力、RDMA、拥塞控制和作业规模。
- 速率:AMD通用前提指南给出100—400GbE或InfiniBand范围;MI350X高层验收示例采用8张400G后端NIC。
- RoCE:需要配置PFC、ECN、DCQCN或相应拥塞控制,并验证无损网络。
- InfiniBand:需要核对HCA、交换机、子网管理器、固件和路由。
- RDMA:确认网卡、驱动、IOMMU、GPU Direct和内存注册工作正常。
- 拓扑:NIC与GPU分组需要和NUMA位置对应。
- 测试:先测主机网络,再测GPU Direct RDMA,最后测RCCL集合通信。
存储与数据供给
大规模训练和推理不仅消耗 GPU 算力,也依赖模型加载、数据集读取、检查点保存和日志写入。存储不足会导致 GPU 等待数据,掩盖真实计算能力。
- 系统盘与训练数据盘分离,系统盘建议做冗余。
- 使用本地NVMe作为模型和数据集缓存,并确认PCIe拓扑。
- 多节点训练需要评估并行文件系统或对象存储吞吐。
- 检查点写入应避免占满后端训练网络。
- 根据数据集大小、epoch、检查点频率和保留策略规划容量。
供电与散热
八卡平台的功率密度很高。MI350X 仅 GPU 模块约 8kW,MI355X 仅 GPU 模块约 11.2kW。整机功耗必须以 OEM 规格为准,不能简单用 GPU 功耗相加后作为机房设计值。
- 确认机柜PDU、母线、电源输入制式和A/B路冗余。
- 确认服务器最大输入功率、启动浪涌和功率限制策略。
- 风冷平台核对CFM、冷热通道和机柜密度。
- 液冷平台核对CDU、流量、温度、压力、水质和漏液检测。
- 在持续满载下记录GPU温度、功耗、频率和降频情况。
ROCm与系统软件
ROCm 部署应采用服务器厂商验证的操作系统、内核、GPU 驱动、ROCm 和固件组合。不要只安装最新版本,也不要将单个组件独立升级到未验证版本。
- 固定OS、内核、BIOS、BMC、PCIe Switch、NIC和GPU固件。
- 安装与GPU型号匹配的ROCm版本。
- 使用容器固化PyTorch、vLLM、SGLang或HPC应用环境。
- 检查RCCL、MIOpen、rocBLAS和其他数学库版本。
- 配置监控、日志、故障收集和版本回退方案。
- 升级前运行完整正确性、性能和稳定性回归。
验收流程应该覆盖什么
AMD 官方客户验收指南将验收分为节点验证和集群网络验证。建议按以下顺序执行:
- 前提检查:OEM兼容性、OS、内核参数、固件、ROCm和依赖。
- 基础健康:GPU识别、驱动日志、显存、温度、功耗和错误状态。
- 单卡基准:计算、HBM带宽和稳定性。
- 节点互联:P2P、PCIe、Infinity Fabric和RCCL。
- 持续压力:满负载运行并观察温度、频率、错误和液冷状态。
- 网络基准:链路、RDMA、GPU Direct和跨节点集合通信。
- 工作负载:使用目标模型或HPC应用验证吞吐、延迟、显存和扩展效率。
- 基线留档:保存版本、拓扑、配置、测试结果和告警阈值。
常见部署误区
- 只看GPU参数,不核对OEM整机和UBB版本。
- 将八卡总显存理解为所有程序都能自动使用。
- 忽略CPU、NUMA和NIC亲和性。
- 按普通以太网方式部署RoCE,未配置拥塞控制。
- 只做单卡跑分,不测试RCCL和跨节点通信。
- 使用未锁定版本的ROCm和容器,导致环境漂移。
- 只按平均功耗设计机房,未考虑持续峰值和冗余。
- 没有使用真实模型进行最终验收。
项目规划前需要哪些信息
- GPU型号、节点数量和未来扩展规模。
- 模型、框架、精度、并行策略和自定义算子。
- 训练、推理、HPC或混合业务。
- 目标吞吐、延迟、训练周期和可用性。
- 机房功率、散热、网络、存储和机柜条件。
- ROCm迁移工作量和团队运维能力。
- OEM平台、供货渠道、保修和技术支持。
AMD八卡平台在国内的实际供货和项目数量相对有限。赋创可结合项目需求协助进行服务器架构、网络、软件栈与验收方案评估,具体产品和交付条件以项目确认结果为准。
常见问题
AMD八卡服务器是八张PCIe卡吗?
通常不是。MI300X至MI355X主力平台采用8个OAM和UBB底板,结构、供电和互联与普通PCIe多卡服务器不同。
八张AMD GPU的显存能直接合并吗?
不能自动形成透明统一显存池,需要模型并行、数据并行或框架切分,并承担通信开销。
AMD八卡服务器一定需要3TB内存吗?
不同型号不同。AMD验收指南对MI350X和MI355X给出3TB级参考,但最终应按工作负载和OEM平台确定。
多节点应该用RoCE还是InfiniBand?
两者均可,需结合现有网络、规模、运维能力和应用通信模式选择,并完成RDMA与RCCL测试。
只安装ROCm就能运行CUDA应用吗?
不能。框架、依赖库、自定义算子和容器都需要检查,部分CUDA代码需要HIP迁移。
八卡服务器验收只跑模型够吗?
不够。还要验证固件、硬件健康、显存、P2P、RCCL、RDMA、温度、功耗和持续稳定性。
MI355X八卡平台可以部署在普通机房吗?
通常需要高功率配电和液冷基础设施,必须先完成机柜、CDU、供回液和运维条件评估。
方案咨询
需要把方案落到实际配置?
联系赋创获取算力、软件栈和交付路径建议。