AI硬件 网络

RDMA

RDMA 是远程直接内存访问能力,是 InfiniBand、RoCE 等高性能网络场景中的关键概念。

networkingai-clusterrdmainfinibandroce
Slug
rdma
更新
2026-05-04
来源
2
关系
3

概览

RDMA 是远程直接内存访问能力,是 InfiniBand、RoCE 等高性能网络场景中的关键概念。

在 赋创 内容库中,RDMA 属于AI 集群网络条目,服务于训练网络、推理网络、RDMA 和以太网/InfiniBand 选型。它的作用是补齐基础设施主干,让后续静态站、搜索索引、关系图谱和方案页都能引用更完整的事实锚点。

本条目默认保持 draft 状态。它可以进入数据库和构建流程,但在发布到默认导航或对外页面前,需要完成来源复核、规格补全和正文二次打磨。

官方可确认信息

  • OpenFabrics Alliance:OpenFabrics Alliance,用于核对官方定位和能力范围。
  • NVIDIA:NVIDIA Networking Software User Manual,用于核对安装、兼容性和操作边界。
  • 本条目当前只固化官方资料能够确认的定位、生态关系和部署边界;显存、带宽、功耗、端口速率、核心数等数字字段在发布前需要逐项回查官方资料。

工程关注点

  • AI 集群网络需要和 NCCL、RDMA、作业规模、拓扑、布线、拥塞控制和故障恢复一起设计。
  • 网络选型不能只看单端口速率,还要看整网收敛比、交换层级、队列配置和运维能力。
  • 训练集群、推理集群和存储网络的目标不同,应分别设计和验收。

选型/部署影响

  • 将 RDMA 纳入 赋创 后,应优先把它连接到现有 GPU、服务器、网络、软件栈和方案条目。
  • 进入 published 前应补齐可追溯规格表,并把工程判断与官方事实分开。
  • 用于网页展示时,建议作为分类页和相关条目的二级入口,不直接替代已发布核心条目。

后续可补充

  • 补齐官方规格字段和访问日期复核记录
  • 补充与核心 published 条目的双向关系
  • 根据静态站分类页需要补充图表、规格表或对比表

配置建议

不确定该硬件是否适合您的模型?

结合模型规模、显存、并发和机房条件,判断 GPU 服务器与集群配置。

获取配置建议查看赋创产品