RDMA
RDMA 是远程直接内存访问能力,是 InfiniBand、RoCE 等高性能网络场景中的关键概念。
networkingai-clusterrdmainfinibandroce
- Slug
rdma- 更新
- 2026-05-04
- 来源
- 2
- 关系
- 3
概览
RDMA 是远程直接内存访问能力,是 InfiniBand、RoCE 等高性能网络场景中的关键概念。
在 赋创 内容库中,RDMA 属于AI 集群网络条目,服务于训练网络、推理网络、RDMA 和以太网/InfiniBand 选型。它的作用是补齐基础设施主干,让后续静态站、搜索索引、关系图谱和方案页都能引用更完整的事实锚点。
本条目默认保持 draft 状态。它可以进入数据库和构建流程,但在发布到默认导航或对外页面前,需要完成来源复核、规格补全和正文二次打磨。
官方可确认信息
- OpenFabrics Alliance:OpenFabrics Alliance,用于核对官方定位和能力范围。
- NVIDIA:NVIDIA Networking Software User Manual,用于核对安装、兼容性和操作边界。
- 本条目当前只固化官方资料能够确认的定位、生态关系和部署边界;显存、带宽、功耗、端口速率、核心数等数字字段在发布前需要逐项回查官方资料。
工程关注点
- AI 集群网络需要和 NCCL、RDMA、作业规模、拓扑、布线、拥塞控制和故障恢复一起设计。
- 网络选型不能只看单端口速率,还要看整网收敛比、交换层级、队列配置和运维能力。
- 训练集群、推理集群和存储网络的目标不同,应分别设计和验收。
选型/部署影响
- 将 RDMA 纳入 赋创 后,应优先把它连接到现有 GPU、服务器、网络、软件栈和方案条目。
- 进入 published 前应补齐可追溯规格表,并把工程判断与官方事实分开。
- 用于网页展示时,建议作为分类页和相关条目的二级入口,不直接替代已发布核心条目。
后续可补充
- 补齐官方规格字段和访问日期复核记录
- 补充与核心 published 条目的双向关系
- 根据静态站分类页需要补充图表、规格表或对比表
配置建议
不确定该硬件是否适合您的模型?
结合模型规模、显存、并发和机房条件,判断 GPU 服务器与集群配置。