指南AI 服务器

AI服务器采购需求信息表:模型、并发、数据与机房条件清单

采购AI服务器前先明确模型版本、精度、上下文、并发、数据规模、网络存储和机房条件。本文提供可直接用于需求沟通的企业AI服务器需求信息表,适用于GPU服务器与集群采购前期梳理。

AI服务器采购AI服务器需求表GPU服务器选型大模型部署GPU集群容量规划机房条件
Slug
ai-server-requirements-checklist
更新
2026-08-06
来源
3
关系
4

先给结论

AI服务器采购最有效的起点不是先报“几张GPU”,而是先把模型、任务、精度、上下文、并发、性能目标、数据、扩展计划与机房条件写清楚。GPU数量应该是这些输入经过容量计算和PoC验证后的结果。

  • 模型决定基础容量:同样是70B,BF16、FP8和不同INT4方案的权重与运行时空间不同。
  • 上下文与并发决定运行时压力:推理显存除了权重,还包括KV Cache、工作区、通信缓冲等。
  • 数据与工作流决定CPU/存储/网络:训练、RAG、Agent、视觉任务的I/O与预处理路径不同。
  • 机房条件是硬边界:供电、机柜、散热、网络和上架条件必须在定配置前确认。

AI服务器采购前,建议先收集这14项信息

字段建议填写内容影响什么
业务任务推理、RAG、Agent、训练、微调、视觉/HPC等决定服务器和软件栈方向
模型准确名称、版本/commit、Dense/MoE决定权重、算子和生态
精度/量化BF16/FP16/FP8/INT8/INT4及量化方案决定容量、性能与质量回归
输入长度典型/P95/最大tokens或数据尺寸决定Prefill、缓存与显存
输出长度典型/P95/最大tokens决定Decode时间和吞吐
并发/到达率平均、峰值;并说明压测口径决定容量与调度策略
响应目标TTFT、TPOT、P95/P99、端到端时延决定“够用”的性能边界
数据规模现有容量、日增量、热/冷数据比例决定本地与共享存储容量
数据访问大文件/小文件、顺序/随机、共享人数决定I/O与文件系统
网络现有以太网/IB、速率、RDMA、多节点计划决定Scale-out路径
扩展周期当前规模、12~24个月预期、是否多节点影响PCIe、交换网络和机柜预留
软件环境OS、驱动、CUDA/其他运行时、框架、容器决定兼容和迁移成本
机房条件机柜U位、功率、PDU/电源、冷却、承重、布线决定设备能否落地
合规运维数据边界、账号权限、监控、HA、维护窗口决定部署和交付方案

模型与工作负载:不要只写“部署大模型”

模型名称和参数量只是第一层。企业实际选型还需要明确模型版本、精度、上下文和业务功能。对于MoE模型,还要区分总参数与激活参数;对于视觉或Agent任务,还要说明图像/视频、工具调用、RAG或代码执行等额外链路。

  • 如果模型尚未最终确定,可列出1~3个候选模型,并明确希望PoC验证的业务任务。
  • 如果使用量化模型,应写清量化格式和来源,不要只写“INT4”;不同实现的算子支持和质量可能不同。
  • 如果需要训练或微调,应说明全参数、LoRA/QLoRA、数据规模、序列长度、全局Batch和目标训练周期。
  • 如果是RAG/Agent,应把Embedding、Reranker、向量库、文档解析或代码执行等CPU/存储负载一起计入。

并发与SLA:如何把“100个人用”变成可计算输入

“100个用户”和“100并发”不是同一个概念。容量规划更需要请求到达率、同时在途请求数、输入/输出长度分布以及响应目标。

原始说法需要继续追问更可用于规划的表达
100个人使用是否同时使用?峰值每分钟多少请求?峰值到达率 + 典型在途并发
要求响应快首字要多快?生成过程是否要流式?TTFT、TPOT/ITL、端到端时延目标
支持128K常用请求是否真的到128K?典型/P95/最大输入长度
吞吐越高越好吞吐增长能否以明显尾延迟换取?SLA约束下的最大稳定吞吐

如果业务尚未上线没有真实数据,可以先给出低/中/高三档流量假设,在PoC中跑容量曲线,再用实测修正。

数据与存储:容量、带宽和共享方式要分开填

  • 模型与镜像:统计模型权重、多个版本、容器镜像和编译缓存;多节点还要考虑分发与回滚。
  • 训练数据:记录数据集总量、文件数量、平均文件大小、预处理和Checkpoint写入方式。
  • RAG与Agent:除原始文档外,还可能有解析中间文件、索引、数据库、代码仓库和日志。
  • 共享需求:本地NVMe适合节点级高带宽工作集,共享存储适合多节点共享、统一数据管理和持久化;两者经常组合使用。

存储配置不应只写“需要20TB”。同样20TB,如果是数亿小文件训练、连续大文件流式读取或模型加载,性能瓶颈完全不同。

机房条件:定GPU之前就应该确认

检查项需要确认常见影响
机柜可用U位、深度、承重、导轨空间高密度GPU服务器可能对深度/重量有要求
供电机柜可用功率、电压、回路、PDU插座/规格、冗余方式决定高功耗服务器数量和电源接入
散热风冷/液冷条件、冷热通道、机房可承载热密度决定可部署设备形态与密度
网络上联端口、交换机、光模块/线缆、IB/RoCE需求影响多节点和存储带宽
管理BMC网络、带外管理、安全区和远程运维影响交付、监控和故障处理

服务器“电源额定瓦数相加”不能直接视为长期IT负载;正式机柜规划应以整机厂商的系统功耗规格、实际配置、供电冗余和设施设计要求核算。

一张需求表最终应该输出什么

  1. 工作负载画像:明确模型、精度、请求长度、并发/训练规模。
  2. 容量假设:给出显存、CPU内存、存储和网络的计算依据以及不确定项。
  3. 候选架构:单机多卡、HGX/PCIe平台或多节点集群的1~2种可验证方案。
  4. PoC计划:用目标模型、目标框架和真实任务验证性能、质量、稳定性及资源峰值。
  5. 机房与扩展检查:确认当前可落地,并为计划期内扩展保留接口。

这样,采购询价就从“按卡报价”变成了一个可验证的工程需求,后续出现配置差异时也能追溯到具体业务假设。

赋创可以在项目中提供哪些支持

赋创可结合客户的目标模型、业务任务、现有软硬件环境和机房条件,协助梳理需求、形成候选AI服务器/集群方案,并在目标环境中完成软硬件适配、PoC基线、容量与稳定性验证。涉及性能与资源数量时,以明确测试条件和实测结果为依据,不把单一理论峰值或厂商公开样例直接等同于客户生产配置。

FAQ|常见问题

采购AI服务器一定要先确定GPU型号吗?

不一定。更稳妥的顺序是先确定模型、任务、精度、上下文、并发和SLA,再筛选满足容量与生态条件的GPU与整机平台。

只有用户数,没有并发数据怎么办?

可以先建立低/中/高三档流量假设,并通过业务原型或API日志逐步收集请求到达率和同时在途请求数,再用PoC容量曲线修正。

显存能装下模型就代表配置够了吗?

不代表。还要为KV Cache或其他运行时状态、框架工作区、通信缓冲和请求波动留空间,同时验证性能和稳定性。

机房功率应该什么时候确认?

应在锁定高密度GPU服务器配置前确认。供电、PDU、散热和机柜条件可能直接限制可部署服务器数量与形态。

需求表填完后可以直接确定采购数量吗?

需求表用于形成容量假设和候选方案;对于大模型、多卡或国产GPU等复杂项目,最终数量仍建议通过目标环境PoC校准。

方案咨询

需要把方案落到实际配置?

联系赋创获取算力、软件栈和交付路径建议。

咨询方案浏览指南