硬件GPU

AMD Instinct MI455X 参数、CDNA 5 架构与 Helios 部署要求

AMD Instinct MI455X 基于第五代 AMD CDNA 架构,配备 432GB HBM4、23.3TB/s 峰值显存带宽,采用 EAM 形态和直接液冷,面向 AMD Helios 72-GPU 机架级 AI 平台。本文说明其关键参数、架构变化、互联方式、ROCm 适配与部署边界。

AMD Instinct MI455XMI455XAMD加速卡CDNA 5HBM4AMD HeliosROCmUALinkUALoEAI训练AI推理机架级AI
Slug
amd-instinct-mi455x
更新
2026-08-13
来源
5
关系
4

概述

AMD Instinct MI455X 是 MI400 系列面向大规模 AI 训练、推理和微调的旗舰加速器,也是第五代 AMD CDNA 架构的首款产品。单卡提供 432GB HBM4 显存和 23.3TB/s 峰值显存带宽,官方 OCP MXFP4 峰值为 40.3PFLOPS,OCP MXFP8 与 FP8 峰值为 20.1PFLOPS。

MI455X 的定位与常见 PCIe 加速卡不同,也不能直接套用 MI355X 的八卡服务器思路。AMD 将其设计为 Helios 机架级方案的核心计算单元:每个计算托盘集成 4 个 MI455X,18 个计算托盘组成 72-GPU 机架,并通过 UALink over Ethernet,也就是 UALoE,建立机架内的 scale-up 互联。

因此,评估 MI455X 时不能只看单卡显存或峰值算力,还要同时考虑计算托盘、机架互联、ROCm 软件栈、直接液冷、供配电和数据中心运维条件。

产品定位

  • 产品方向:面向前沿模型训练、大规模推理、持续微调和高密度 AI 基础设施。
  • 核心特征:432GB HBM4、23.3TB/s 峰值显存带宽、CDNA 5 低精度计算和机架级互联。
  • 模块形态:Enhanced Accelerator Module,简称 EAM,不是普通 PCIe 插卡。
  • 典型平台:AMD Helios 72-GPU 机架级参考架构,采用 18 个 4-GPU 计算托盘。
  • 散热方式:官方规格明确为直接液冷,部署前需要完成服务器、机架和机房侧联合评估。
  • 软件基础:AMD ROCm、HIP、RCCL及经过验证的训练、推理和分布式框架。

核心参数规格

参数 AMD Instinct MI455X 说明
GPU 架构 第五代 AMD CDNA 面向大规模 AI 训练与推理
制造工艺 TSMC 2nm / 3nm FinFET 计算芯粒采用 N2,其他功能芯粒采用 N3 级工艺
计算组织 256 个 WGP 8 个 CDNA 5 XCD,采用 Wave32 执行
峰值引擎频率 2400MHz 峰值频率不等同于持续工作频率
晶体管数量 3200 亿 多芯粒封装的合计公开值
显存 432GB HBM4 12 个 HBM4 堆栈,支持 ECC
峰值显存带宽 23.3TB/s 峰值理论值
L2 缓存 192MB 分布在两个 Fabric and Cache Die 上
OCP MXFP4 矩阵峰值 40.3PFLOPS 理论密集峰值
OCP MXFP6 / MXFP8 / FP8 矩阵峰值 20.1PFLOPS 理论密集峰值
FP16 / BF16 矩阵峰值 5PFLOPS 不含结构化稀疏增益
FP32 矩阵 / 矢量峰值 315TFLOPS 理论峰值
FP64 矩阵 / 矢量峰值 5TFLOPS MI455X 侧重 AI 低精度和矩阵计算
模块形态 EAM 用于 Helios 4-GPU 计算托盘
CPU 与 GPU 互联 峰值双向 256GB/s AMD Infinity Fabric 连接
Scale-up 互联 峰值双向 3.6TB/s / GPU UALoE,用于机架内 GPU 互联
Scale-out 带宽 峰值双向 600GB/s / GPU 通过 UALink 接入 AMD AI NIC
散热 直接液冷 需采用经过验证的计算托盘与机架方案
虚拟化 支持 SR-IOV 实际能力以整机、固件和软件支持矩阵为准

表中的 PFLOPS、TFLOPS 和带宽均为官方峰值规格。低精度格式、结构化稀疏、模型精度和框架内核不能混合比较,理论峰值也不能直接换算为 Tokens/s。AMD 当前公开的 MI455X 产品规格与产品手册没有给出单卡 TBP,项目规划不应使用第三方估算值替代正式功耗参数。

CDNA 5 改了什么

Wave32 与 SIMD32

CDNA 5 将核心执行方式转向 Wave32 与 SIMD32。相比前代以 Wave64 和较窄 SIMD 为基础的组织方式,新的执行结构可以用更小的线程组完成调度,降低部分同步与指令执行开销,并提高矢量单元利用率。它不是简单增加核心数量,而是重做了 WGP 内部的执行组织。

这类架构变化能否转化为实际收益,仍取决于编译器、算子实现、模型结构和批量。不能仅凭 Wave32 或峰值数字推导固定的训练、推理加速比例。

低精度计算

MI455X 支持 OCP MXFP4、MXFP6、MXFP8 和 FP8 等低精度格式,并增加了面向缩放和反量化的数据通路优化。低精度有助于降低模型权重与中间数据的存储和带宽压力,但实际使用需要同时满足三项条件:模型精度可以接受、框架提供对应内核、量化和校准流程已经验证。

多芯粒与封装

MI455X 采用 8 个计算芯粒、2 个 Fabric and Cache Die、2 个 I/O Die 和 12 个 HBM4 堆栈。计算、缓存、内存控制器和外部互联被分配到不同功能芯粒,再通过先进封装连接。相比把所有功能集中在单一大芯片上,这种结构允许 AMD 针对不同功能选择工艺和芯粒布局。

公开资料显示,MI455X 采用 CoWoS-L 封装。该变化主要服务于更大的多芯粒封装、更多 HBM 堆栈和更复杂的高速互联,不应被简单理解为单一性能指标。

432GB HBM4 如何理解

432GB HBM4 的直接价值是为模型权重、KV Cache、激活值、批量和运行时工作区提供更大的单卡空间。23.3TB/s 峰值带宽则有助于向计算单元持续供给权重与张量数据,对大模型解码、注意力计算和其他显存带宽敏感任务尤其重要。

如果只计算模型权重,不计量化元数据、框架工作区、KV Cache、激活值和系统保留,按标称十进制容量估算,单卡理论容量可以用“显存容量 ÷ 每个参数字节数”进行初筛:

权重精度 每参数理论占用 432GB 可容纳的理论权重规模 使用边界
FP16 / BF16 约 2 字节 约 2160 亿参数 未计任何运行时开销
FP8 / INT8 约 1 字节 约 4320 亿参数 需确认模型与内核支持
FP4 类格式 约 0.5 字节 约 8640 亿参数 还需计入缩放因子和量化元数据

这些数字只能用于容量初筛,不能作为“某个模型可以单卡生产部署”的结论。推理还要为 KV Cache、并发、上下文和框架工作区预留显存;训练还要考虑梯度、优化器状态和激活值,显存需求通常远高于仅加载权重。

从四卡托盘到 Helios

MI455X 的官方平台边界从传统八卡服务器扩展到了机架。AMD Helios 参考架构由 18 个 1OU 单路 CPU、4-GPU 计算托盘和 6 个交换托盘组成,合计 72 个 MI455X。整机架提供最高约 31TB HBM4 和 1.67PB/s 聚合显存带宽。

机架内使用 UALoE 建立单跳、多平面的 scale-up 网络。每个 GPU 的峰值双向 scale-up 带宽为 3.6TB/s,72 个 GPU 形成一个机架级扩展域。跨机架则通过基于以太网和 UEC 方向的 scale-out 网络继续扩展。

“31TB HBM4”是 72 张 GPU 的聚合容量,不等同于一张 GPU 拥有 31TB 本地显存。模型仍需采用张量并行、流水线并行、专家并行或其他分布式策略,性能还会受到通信模式、拓扑、软件调度和负载均衡影响。

软件生态与适配

MI455X 以 AMD ROCm 为软件基础。AMD 官方列出的支持方向包括 PyTorch、TensorFlow、JAX、ONNX Runtime、vLLM、SGLang 和 Triton 等,但“框架支持 MI455X”不等于所有模型、插件和自定义算子可以无修改运行。

  • 锁定操作系统、内核、GPU 固件、ROCm、框架、RCCL、容器和模型镜像的完整版本组合。
  • 确认 FlashAttention、MoE、量化、融合算子和自定义 CUDA 扩展是否已有 ROCm 实现。
  • 低精度项目需要验证权重量化、缩放格式、精度损失和对应矩阵内核。
  • 分布式训练与推理需要同时验证 GPU 内存、UALoE、AI NIC、RCCL 和跨机架网络。
  • 上线前使用目标模型测试正确性、首 Token 延迟、吞吐、显存占用、扩展效率和长时间稳定性。

适用任务与场景

  • 需要机架级计算与显存容量的前沿模型训练、继续预训练和持续微调。
  • 高并发、大批量、长上下文或大 KV Cache 的大规模推理服务。
  • MoE 模型的训练与推理,但需重点验证专家并行和 all-to-all 通信。
  • 多租户 AI 云、主权 AI 基础设施和大型科研计算中心的 AI 资源池。
  • 需要从单机架扩展到多机架的 AI 集群,并具备液冷、配电和专业运维条件。

MI455X 并不适合仅需要少量 GPU 的常规私有化部署,也不应因为采用新一代架构就默认适合所有传统 HPC 任务。其公开 FP64 峰值为 5TFLOPS,产品重心明显偏向 AI 低精度与矩阵计算;高 FP64 科学计算应单独评估 MI430X、MI355X 或其他 HPC 加速平台。

部署关注点

  • 平台:确认采用经过验证的 MI455X 计算托盘、交换托盘、机架和管理方案,不能按普通 PCIe GPU 服务器选型。
  • 供电:以 OEM 或 Helios 实施方案的整机架输入功率、PDU、母线、A/B 路和功率限制设计为准。
  • 液冷:核对 CDU、冷板、快接头、流量、温度、压差、水质、泄漏监控和冗余策略。
  • 机房:评估双宽 ORW 机架空间、楼板承重、运输通道、设施水、换热和消防运维条件。
  • 互联:同时评估 UALoE scale-up、AI NIC、跨机架以太网、无损网络和拥塞控制。
  • 软件:采用 OEM 与 AMD 验证的软件组合,避免单独升级驱动、固件或框架后破坏兼容性。
  • 验收:覆盖单 GPU、4-GPU 托盘、72-GPU 扩展域、网络、液冷、功耗、故障切换和目标工作负载。

MI455X 与 MI355X 怎么选

维度 AMD Instinct MI355X AMD Instinct MI455X
架构 第四代 CDNA 第五代 CDNA
计算组织 256 个 CU,Wave64 为主要执行方式 256 个 WGP,Wave32 执行
显存 288GB HBM3E 432GB HBM4
峰值显存带宽 8TB/s 23.3TB/s
OCP MXFP4 矩阵峰值 10.1PFLOPS 40.3PFLOPS
FP8 矩阵峰值 5PFLOPS 20.1PFLOPS
FP64 峰值 78.6TFLOPS 5TFLOPS
模块与典型平台 OAM,八卡 UBB 2.0 服务器 EAM,4-GPU 计算托盘与 72-GPU Helios
散热 按 OEM 平台采用风冷或液冷,1400W 型号通常用于高密度液冷 官方规格为直接液冷
单卡功耗公开状态 1400W TBP 官方暂未公开单卡 TBP
主要方向 八卡 AI 与 HPC 高密度平台 机架级大模型训练与推理平台

MI455X 在显存、带宽、低精度计算和 scale-up 范围上明显扩展,但它不是 MI355X 的插槽级替换。MI355X 面向 OAM 与八卡 UBB 2.0 平台,MI455X 面向 EAM、4-GPU 托盘和 Helios 机架级架构,两者的服务器、互联、液冷与机房条件不同。

如果需求仍以单节点或少量节点为主,且需要兼顾较高 FP64 能力,MI355X 仍应按实际负载评估。只有当模型规模、并发和扩展目标能够利用 432GB HBM4、UALoE 与机架级资源时,才有必要进一步评估 MI455X / Helios。

进一步选型需要哪些信息

  • 目标模型、总参数量、激活参数量、训练或推理任务。
  • 权重精度、计算精度、上下文长度、批量、并发和时延目标。
  • 模型是否为 MoE,以及张量并行、流水线并行和专家并行策略。
  • ROCm、框架、量化库、自定义算子和容器的适配状态。
  • 计划采用单个计算托盘、单机架还是多机架规模。
  • 机房的供电、液冷、机架空间、网络和运维能力。
  • OEM 平台、供应时间、保修、备件和现场服务条件。

赋创可结合上述信息,为客户提供 AI 算力平台选型、部署规划与 PoC 验证建议。涉及 MI455X 的项目,应优先把模型、软件栈和数据中心条件作为一体化系统进行评估,而不是先确定 GPU 数量再补齐其他资源。

常见问题

MI455X 有多少显存?

单卡提供 432GB HBM4,由 12 个 HBM4 堆栈组成,峰值显存带宽为 23.3TB/s,并支持 ECC。

MI455X 是普通 PCIe 加速卡吗?

不是。MI455X 采用 EAM 形态,官方将其用于 Helios 的 4-GPU 液冷计算托盘,不能按普通 PCIe 插卡安装到通用服务器中。

MI455X 的单卡功耗是多少?

截至 2026 年 8 月 13 日,AMD 公开的 MI455X 产品页和产品手册没有给出单卡 TBP。第三方可根据机架设计推测功耗范围,但项目供电和制冷设计必须以 OEM 或正式方案规格为准。

72 张 MI455X 的 31TB HBM4 能当作一块显存使用吗?

不能这样简单理解。31TB 是 72 张 GPU 的聚合显存容量,GPU 之间通过 UALoE 组成 scale-up 域。模型仍需进行并行切分,并承担通信、同步和调度开销。

MI455X 适合传统 HPC 吗?

需要按精度和应用单独判断。MI455X 的公开 FP64 峰值为 5TFLOPS,产品重点是 AI 低精度与矩阵计算。需要高 FP64 矢量性能的科学计算,应同步评估 MI430X、MI355X 或其他 HPC 平台。

CUDA 应用可以直接迁移到 MI455X 吗?

不能直接假设。MI455X 使用 ROCm 和 HIP 软件栈,依赖 CUDA 闭源组件、自定义算子或特定插件的应用,需要迁移、替换或采用已经验证的 ROCm 版本。

MI455X 什么时候可以部署?

AMD 官方产品页标注的发布日期为 2026 年 7 月 23 日,并表示 Helios 将在 2026 年下半年开始交付。具体 OEM 型号、国内供应、价格和交期仍需按项目时间核实,不能根据发布信息推断现货。

MI455X 比 MI355X 快多少?

官方峰值规格中,MI455X 的 OCP MXFP4 与 FP8 矩阵峰值约为 MI355X 的 4 倍,显存容量为 1.5 倍,峰值显存带宽约为 2.9 倍。但真实模型性能取决于精度、算子、批量、上下文、互联和软件版本,不能把理论倍数直接写成通用训练或推理加速比例。

配置建议

MI455X / Helios 是否适合您的项目?

结合模型规模、精度、上下文、并发、软件栈及机房条件,评估机架级 AI 平台的配置与部署边界。

获取配置建议查看赋创产品