AI硬件 网络

InfiniBand

InfiniBand 是高性能低时延网络技术,常用于大规模 AI 训练集群和高性能计算环境。

networkinginfinibandrdmaai-trainingcluster-network
Slug
infiniband
更新
2026-05-03
来源
2
关系
3

概览

InfiniBand 是面向高性能计算和大规模 AI 集群的低时延、高带宽网络技术。在很多多节点训练场景中,它不是“锦上添花”的网络升级,而是决定 GPU 利用率、训练吞吐和作业稳定性的基础设施。

对于 赋创 而言,InfiniBand 应作为训练集群建设、分布式通信、NCCLRDMA 和网络拓扑条目的关键锚点。

为什么它重要

多节点训练依赖高性能网络

当训练从单机扩展到多节点后,系统瓶颈往往不再只是 GPU 计算能力,而是节点间通信。如果网络带宽不足、拥塞控制不佳或时延过高,GPU 会频繁等待数据交换,导致利用率下降。

AI 集群需要确定性的通信能力

InfiniBand 的价值不仅在于带宽,还在于其围绕 RDMA、自适应路由、拥塞控制和高性能交换网络形成的整体能力。

典型使用场景

大模型训练集群

多机多卡训练,尤其是 数据并行张量并行流水线并行 组合场景,对网络性能极为敏感,InfiniBand 因此常成为训练平台首选。

高性能科研计算

在科学计算、仿真和 HPC 环境中,InfiniBand 也常用于承载大规模节点间通信。

与以太网 / RoCE 的关系

InfiniBand 并不意味着所有场景都必须使用它。对于规模较小、预算有限或运维团队更熟悉以太网体系的组织,RoCE 或高规格以太网依然有现实价值。

但如果目标是高端训练平台、超大规模集群或极端通信敏感型任务,InfiniBand 仍然具有明显优势。

选型关注点

  • 节点规模越大,网络设计的重要性越高
  • 需要把交换机、网卡、布线和拓扑一起评估
  • 训练集群要同时考虑拥塞控制、路由和故障恢复
  • 不应只看“单端口速率”,还要看整网拓扑与可扩展性

发布复核说明

本条目已按 NVIDIA Quantum-2 与 NDR 技术资料做发布前复核,可作为 AI 集群网络条目的一级入口。

  • 发布边界:本文只解释 InfiniBand 在 AI 集群中的工程定位,不逐字段列出端口速率、交换机型号和线缆规格。
  • 选型延伸:RoCE 与 InfiniBand 的路线取舍应继续参考 comparison-roce-vs-infiniband
  • 工程风险:网络方案需要结合 GPU 数量、节点规模、NCCL 通信模式、机房布线和运维能力共同确认。

配置建议

不确定该硬件是否适合您的模型?

结合模型规模、显存、并发和机房条件,判断 GPU 服务器与集群配置。

获取配置建议查看赋创产品