AMD Instinct MI455X 参数、CDNA 5 架构与 Helios 部署要求
AMD Instinct MI455X 基于第五代 AMD CDNA 架构,配备 432GB HBM4、23.3TB/s 峰值显存带宽,采用 EAM 形态和直接液冷,面向 AMD Helios 72-GPU 机架级 AI 平台。本文说明其关键参数、架构变化、互联方式、ROCm 适配与部署边界。
- Slug
amd-instinct-mi455x- 更新
- 2026-08-13
- 来源
- 5
- 关系
- 4
概述
AMD Instinct MI455X 是 MI400 系列面向大规模 AI 训练、推理和微调的旗舰加速器,也是第五代 AMD CDNA 架构的首款产品。单卡提供 432GB HBM4 显存和 23.3TB/s 峰值显存带宽,官方 OCP MXFP4 峰值为 40.3PFLOPS,OCP MXFP8 与 FP8 峰值为 20.1PFLOPS。
MI455X 的定位与常见 PCIe 加速卡不同,也不能直接套用 MI355X 的八卡服务器思路。AMD 将其设计为 Helios 机架级方案的核心计算单元:每个计算托盘集成 4 个 MI455X,18 个计算托盘组成 72-GPU 机架,并通过 UALink over Ethernet,也就是 UALoE,建立机架内的 scale-up 互联。
因此,评估 MI455X 时不能只看单卡显存或峰值算力,还要同时考虑计算托盘、机架互联、ROCm 软件栈、直接液冷、供配电和数据中心运维条件。
产品定位
- 产品方向:面向前沿模型训练、大规模推理、持续微调和高密度 AI 基础设施。
- 核心特征:432GB HBM4、23.3TB/s 峰值显存带宽、CDNA 5 低精度计算和机架级互联。
- 模块形态:Enhanced Accelerator Module,简称 EAM,不是普通 PCIe 插卡。
- 典型平台:AMD Helios 72-GPU 机架级参考架构,采用 18 个 4-GPU 计算托盘。
- 散热方式:官方规格明确为直接液冷,部署前需要完成服务器、机架和机房侧联合评估。
- 软件基础:AMD ROCm、HIP、RCCL及经过验证的训练、推理和分布式框架。
核心参数规格
| 参数 | AMD Instinct MI455X | 说明 |
|---|---|---|
| GPU 架构 | 第五代 AMD CDNA | 面向大规模 AI 训练与推理 |
| 制造工艺 | TSMC 2nm / 3nm FinFET | 计算芯粒采用 N2,其他功能芯粒采用 N3 级工艺 |
| 计算组织 | 256 个 WGP | 8 个 CDNA 5 XCD,采用 Wave32 执行 |
| 峰值引擎频率 | 2400MHz | 峰值频率不等同于持续工作频率 |
| 晶体管数量 | 3200 亿 | 多芯粒封装的合计公开值 |
| 显存 | 432GB HBM4 | 12 个 HBM4 堆栈,支持 ECC |
| 峰值显存带宽 | 23.3TB/s | 峰值理论值 |
| L2 缓存 | 192MB | 分布在两个 Fabric and Cache Die 上 |
| OCP MXFP4 矩阵峰值 | 40.3PFLOPS | 理论密集峰值 |
| OCP MXFP6 / MXFP8 / FP8 矩阵峰值 | 20.1PFLOPS | 理论密集峰值 |
| FP16 / BF16 矩阵峰值 | 5PFLOPS | 不含结构化稀疏增益 |
| FP32 矩阵 / 矢量峰值 | 315TFLOPS | 理论峰值 |
| FP64 矩阵 / 矢量峰值 | 5TFLOPS | MI455X 侧重 AI 低精度和矩阵计算 |
| 模块形态 | EAM | 用于 Helios 4-GPU 计算托盘 |
| CPU 与 GPU 互联 | 峰值双向 256GB/s | AMD Infinity Fabric 连接 |
| Scale-up 互联 | 峰值双向 3.6TB/s / GPU | UALoE,用于机架内 GPU 互联 |
| Scale-out 带宽 | 峰值双向 600GB/s / GPU | 通过 UALink 接入 AMD AI NIC |
| 散热 | 直接液冷 | 需采用经过验证的计算托盘与机架方案 |
| 虚拟化 | 支持 SR-IOV | 实际能力以整机、固件和软件支持矩阵为准 |
表中的 PFLOPS、TFLOPS 和带宽均为官方峰值规格。低精度格式、结构化稀疏、模型精度和框架内核不能混合比较,理论峰值也不能直接换算为 Tokens/s。AMD 当前公开的 MI455X 产品规格与产品手册没有给出单卡 TBP,项目规划不应使用第三方估算值替代正式功耗参数。
CDNA 5 改了什么
Wave32 与 SIMD32
CDNA 5 将核心执行方式转向 Wave32 与 SIMD32。相比前代以 Wave64 和较窄 SIMD 为基础的组织方式,新的执行结构可以用更小的线程组完成调度,降低部分同步与指令执行开销,并提高矢量单元利用率。它不是简单增加核心数量,而是重做了 WGP 内部的执行组织。
这类架构变化能否转化为实际收益,仍取决于编译器、算子实现、模型结构和批量。不能仅凭 Wave32 或峰值数字推导固定的训练、推理加速比例。
低精度计算
MI455X 支持 OCP MXFP4、MXFP6、MXFP8 和 FP8 等低精度格式,并增加了面向缩放和反量化的数据通路优化。低精度有助于降低模型权重与中间数据的存储和带宽压力,但实际使用需要同时满足三项条件:模型精度可以接受、框架提供对应内核、量化和校准流程已经验证。
多芯粒与封装
MI455X 采用 8 个计算芯粒、2 个 Fabric and Cache Die、2 个 I/O Die 和 12 个 HBM4 堆栈。计算、缓存、内存控制器和外部互联被分配到不同功能芯粒,再通过先进封装连接。相比把所有功能集中在单一大芯片上,这种结构允许 AMD 针对不同功能选择工艺和芯粒布局。
公开资料显示,MI455X 采用 CoWoS-L 封装。该变化主要服务于更大的多芯粒封装、更多 HBM 堆栈和更复杂的高速互联,不应被简单理解为单一性能指标。
432GB HBM4 如何理解
432GB HBM4 的直接价值是为模型权重、KV Cache、激活值、批量和运行时工作区提供更大的单卡空间。23.3TB/s 峰值带宽则有助于向计算单元持续供给权重与张量数据,对大模型解码、注意力计算和其他显存带宽敏感任务尤其重要。
如果只计算模型权重,不计量化元数据、框架工作区、KV Cache、激活值和系统保留,按标称十进制容量估算,单卡理论容量可以用“显存容量 ÷ 每个参数字节数”进行初筛:
| 权重精度 | 每参数理论占用 | 432GB 可容纳的理论权重规模 | 使用边界 |
|---|---|---|---|
| FP16 / BF16 | 约 2 字节 | 约 2160 亿参数 | 未计任何运行时开销 |
| FP8 / INT8 | 约 1 字节 | 约 4320 亿参数 | 需确认模型与内核支持 |
| FP4 类格式 | 约 0.5 字节 | 约 8640 亿参数 | 还需计入缩放因子和量化元数据 |
这些数字只能用于容量初筛,不能作为“某个模型可以单卡生产部署”的结论。推理还要为 KV Cache、并发、上下文和框架工作区预留显存;训练还要考虑梯度、优化器状态和激活值,显存需求通常远高于仅加载权重。
从四卡托盘到 Helios
MI455X 的官方平台边界从传统八卡服务器扩展到了机架。AMD Helios 参考架构由 18 个 1OU 单路 CPU、4-GPU 计算托盘和 6 个交换托盘组成,合计 72 个 MI455X。整机架提供最高约 31TB HBM4 和 1.67PB/s 聚合显存带宽。
机架内使用 UALoE 建立单跳、多平面的 scale-up 网络。每个 GPU 的峰值双向 scale-up 带宽为 3.6TB/s,72 个 GPU 形成一个机架级扩展域。跨机架则通过基于以太网和 UEC 方向的 scale-out 网络继续扩展。
“31TB HBM4”是 72 张 GPU 的聚合容量,不等同于一张 GPU 拥有 31TB 本地显存。模型仍需采用张量并行、流水线并行、专家并行或其他分布式策略,性能还会受到通信模式、拓扑、软件调度和负载均衡影响。
软件生态与适配
MI455X 以 AMD ROCm 为软件基础。AMD 官方列出的支持方向包括 PyTorch、TensorFlow、JAX、ONNX Runtime、vLLM、SGLang 和 Triton 等,但“框架支持 MI455X”不等于所有模型、插件和自定义算子可以无修改运行。
- 锁定操作系统、内核、GPU 固件、ROCm、框架、RCCL、容器和模型镜像的完整版本组合。
- 确认 FlashAttention、MoE、量化、融合算子和自定义 CUDA 扩展是否已有 ROCm 实现。
- 低精度项目需要验证权重量化、缩放格式、精度损失和对应矩阵内核。
- 分布式训练与推理需要同时验证 GPU 内存、UALoE、AI NIC、RCCL 和跨机架网络。
- 上线前使用目标模型测试正确性、首 Token 延迟、吞吐、显存占用、扩展效率和长时间稳定性。
适用任务与场景
- 需要机架级计算与显存容量的前沿模型训练、继续预训练和持续微调。
- 高并发、大批量、长上下文或大 KV Cache 的大规模推理服务。
- MoE 模型的训练与推理,但需重点验证专家并行和 all-to-all 通信。
- 多租户 AI 云、主权 AI 基础设施和大型科研计算中心的 AI 资源池。
- 需要从单机架扩展到多机架的 AI 集群,并具备液冷、配电和专业运维条件。
MI455X 并不适合仅需要少量 GPU 的常规私有化部署,也不应因为采用新一代架构就默认适合所有传统 HPC 任务。其公开 FP64 峰值为 5TFLOPS,产品重心明显偏向 AI 低精度与矩阵计算;高 FP64 科学计算应单独评估 MI430X、MI355X 或其他 HPC 加速平台。
部署关注点
- 平台:确认采用经过验证的 MI455X 计算托盘、交换托盘、机架和管理方案,不能按普通 PCIe GPU 服务器选型。
- 供电:以 OEM 或 Helios 实施方案的整机架输入功率、PDU、母线、A/B 路和功率限制设计为准。
- 液冷:核对 CDU、冷板、快接头、流量、温度、压差、水质、泄漏监控和冗余策略。
- 机房:评估双宽 ORW 机架空间、楼板承重、运输通道、设施水、换热和消防运维条件。
- 互联:同时评估 UALoE scale-up、AI NIC、跨机架以太网、无损网络和拥塞控制。
- 软件:采用 OEM 与 AMD 验证的软件组合,避免单独升级驱动、固件或框架后破坏兼容性。
- 验收:覆盖单 GPU、4-GPU 托盘、72-GPU 扩展域、网络、液冷、功耗、故障切换和目标工作负载。
MI455X 与 MI355X 怎么选
| 维度 | AMD Instinct MI355X | AMD Instinct MI455X |
|---|---|---|
| 架构 | 第四代 CDNA | 第五代 CDNA |
| 计算组织 | 256 个 CU,Wave64 为主要执行方式 | 256 个 WGP,Wave32 执行 |
| 显存 | 288GB HBM3E | 432GB HBM4 |
| 峰值显存带宽 | 8TB/s | 23.3TB/s |
| OCP MXFP4 矩阵峰值 | 10.1PFLOPS | 40.3PFLOPS |
| FP8 矩阵峰值 | 5PFLOPS | 20.1PFLOPS |
| FP64 峰值 | 78.6TFLOPS | 5TFLOPS |
| 模块与典型平台 | OAM,八卡 UBB 2.0 服务器 | EAM,4-GPU 计算托盘与 72-GPU Helios |
| 散热 | 按 OEM 平台采用风冷或液冷,1400W 型号通常用于高密度液冷 | 官方规格为直接液冷 |
| 单卡功耗公开状态 | 1400W TBP | 官方暂未公开单卡 TBP |
| 主要方向 | 八卡 AI 与 HPC 高密度平台 | 机架级大模型训练与推理平台 |
MI455X 在显存、带宽、低精度计算和 scale-up 范围上明显扩展,但它不是 MI355X 的插槽级替换。MI355X 面向 OAM 与八卡 UBB 2.0 平台,MI455X 面向 EAM、4-GPU 托盘和 Helios 机架级架构,两者的服务器、互联、液冷与机房条件不同。
如果需求仍以单节点或少量节点为主,且需要兼顾较高 FP64 能力,MI355X 仍应按实际负载评估。只有当模型规模、并发和扩展目标能够利用 432GB HBM4、UALoE 与机架级资源时,才有必要进一步评估 MI455X / Helios。
进一步选型需要哪些信息
- 目标模型、总参数量、激活参数量、训练或推理任务。
- 权重精度、计算精度、上下文长度、批量、并发和时延目标。
- 模型是否为 MoE,以及张量并行、流水线并行和专家并行策略。
- ROCm、框架、量化库、自定义算子和容器的适配状态。
- 计划采用单个计算托盘、单机架还是多机架规模。
- 机房的供电、液冷、机架空间、网络和运维能力。
- OEM 平台、供应时间、保修、备件和现场服务条件。
赋创可结合上述信息,为客户提供 AI 算力平台选型、部署规划与 PoC 验证建议。涉及 MI455X 的项目,应优先把模型、软件栈和数据中心条件作为一体化系统进行评估,而不是先确定 GPU 数量再补齐其他资源。
常见问题
MI455X 有多少显存?
单卡提供 432GB HBM4,由 12 个 HBM4 堆栈组成,峰值显存带宽为 23.3TB/s,并支持 ECC。
MI455X 是普通 PCIe 加速卡吗?
不是。MI455X 采用 EAM 形态,官方将其用于 Helios 的 4-GPU 液冷计算托盘,不能按普通 PCIe 插卡安装到通用服务器中。
MI455X 的单卡功耗是多少?
截至 2026 年 8 月 13 日,AMD 公开的 MI455X 产品页和产品手册没有给出单卡 TBP。第三方可根据机架设计推测功耗范围,但项目供电和制冷设计必须以 OEM 或正式方案规格为准。
72 张 MI455X 的 31TB HBM4 能当作一块显存使用吗?
不能这样简单理解。31TB 是 72 张 GPU 的聚合显存容量,GPU 之间通过 UALoE 组成 scale-up 域。模型仍需进行并行切分,并承担通信、同步和调度开销。
MI455X 适合传统 HPC 吗?
需要按精度和应用单独判断。MI455X 的公开 FP64 峰值为 5TFLOPS,产品重点是 AI 低精度与矩阵计算。需要高 FP64 矢量性能的科学计算,应同步评估 MI430X、MI355X 或其他 HPC 平台。
CUDA 应用可以直接迁移到 MI455X 吗?
不能直接假设。MI455X 使用 ROCm 和 HIP 软件栈,依赖 CUDA 闭源组件、自定义算子或特定插件的应用,需要迁移、替换或采用已经验证的 ROCm 版本。
MI455X 什么时候可以部署?
AMD 官方产品页标注的发布日期为 2026 年 7 月 23 日,并表示 Helios 将在 2026 年下半年开始交付。具体 OEM 型号、国内供应、价格和交期仍需按项目时间核实,不能根据发布信息推断现货。
MI455X 比 MI355X 快多少?
官方峰值规格中,MI455X 的 OCP MXFP4 与 FP8 矩阵峰值约为 MI355X 的 4 倍,显存容量为 1.5 倍,峰值显存带宽约为 2.9 倍。但真实模型性能取决于精度、算子、批量、上下文、互联和软件版本,不能把理论倍数直接写成通用训练或推理加速比例。
配置建议
MI455X / Helios 是否适合您的项目?
结合模型规模、精度、上下文、并发、软件栈及机房条件,评估机架级 AI 平台的配置与部署边界。