RoCEv2
RoCEv2 通过以太网实现 RDMA 低时延传输,是 AI 集群常见互联方案。本文介绍其协议机制、拥塞控制、网络配置要求,以及与 InfiniBand 的差异。
networkingai-clusterrocerdmaethernet
- Slug
rocev2- 更新
- 2026-05-04
- 来源
- 2
- 关系
- 3
概览
RoCEv2 是在以太网上承载 RDMA 的技术路线之一,常用于 AI 集群以太网方案。
在 赋创 内容库中,RoCEv2 属于AI 集群网络条目,服务于训练网络、推理网络、RDMA 和以太网/InfiniBand 选型。它的作用是补齐基础设施主干,让后续静态站、搜索索引、关系图谱和方案页都能引用更完整的事实锚点。
官方可确认信息
- NVIDIA:NVIDIA RoCE Documentation,用于核对安装、兼容性和操作边界。
- RDMA Consortium:RDMA Consortium Specifications,用于核对官方定位和能力范围。
- 本条目当前只固化官方资料能够确认的定位、生态关系和部署边界;显存、带宽、功耗、端口速率、核心数等数字字段在发布前需要逐项回查官方资料。
工程关注点
- AI 集群网络需要和 NCCL、RDMA、作业规模、拓扑、布线、拥塞控制和故障恢复一起设计。
- 网络选型不能只看单端口速率,还要看整网收敛比、交换层级、队列配置和运维能力。
- 训练集群、推理集群和存储网络的目标不同,应分别设计和验收。
配置建议
不确定该硬件是否适合您的模型?
结合模型规模、显存、并发和机房条件,判断 GPU 服务器与集群配置。