AI服务器采购需求信息表:模型、并发、数据与机房条件清单
采购AI服务器前先明确模型版本、精度、上下文、并发、数据规模、网络存储和机房条件。本文提供可直接用于需求沟通的企业AI服务器需求信息表,适用于GPU服务器与集群采购前期梳理。
- Slug
ai-server-requirements-checklist- 更新
- 2026-08-06
- 来源
- 3
- 关系
- 4
先给结论
AI服务器采购最有效的起点不是先报“几张GPU”,而是先把模型、任务、精度、上下文、并发、性能目标、数据、扩展计划与机房条件写清楚。GPU数量应该是这些输入经过容量计算和PoC验证后的结果。
- 模型决定基础容量:同样是70B,BF16、FP8和不同INT4方案的权重与运行时空间不同。
- 上下文与并发决定运行时压力:推理显存除了权重,还包括KV Cache、工作区、通信缓冲等。
- 数据与工作流决定CPU/存储/网络:训练、RAG、Agent、视觉任务的I/O与预处理路径不同。
- 机房条件是硬边界:供电、机柜、散热、网络和上架条件必须在定配置前确认。
AI服务器采购前,建议先收集这14项信息
| 字段 | 建议填写内容 | 影响什么 |
|---|---|---|
| 业务任务 | 推理、RAG、Agent、训练、微调、视觉/HPC等 | 决定服务器和软件栈方向 |
| 模型 | 准确名称、版本/commit、Dense/MoE | 决定权重、算子和生态 |
| 精度/量化 | BF16/FP16/FP8/INT8/INT4及量化方案 | 决定容量、性能与质量回归 |
| 输入长度 | 典型/P95/最大tokens或数据尺寸 | 决定Prefill、缓存与显存 |
| 输出长度 | 典型/P95/最大tokens | 决定Decode时间和吞吐 |
| 并发/到达率 | 平均、峰值;并说明压测口径 | 决定容量与调度策略 |
| 响应目标 | TTFT、TPOT、P95/P99、端到端时延 | 决定“够用”的性能边界 |
| 数据规模 | 现有容量、日增量、热/冷数据比例 | 决定本地与共享存储容量 |
| 数据访问 | 大文件/小文件、顺序/随机、共享人数 | 决定I/O与文件系统 |
| 网络 | 现有以太网/IB、速率、RDMA、多节点计划 | 决定Scale-out路径 |
| 扩展周期 | 当前规模、12~24个月预期、是否多节点 | 影响PCIe、交换网络和机柜预留 |
| 软件环境 | OS、驱动、CUDA/其他运行时、框架、容器 | 决定兼容和迁移成本 |
| 机房条件 | 机柜U位、功率、PDU/电源、冷却、承重、布线 | 决定设备能否落地 |
| 合规运维 | 数据边界、账号权限、监控、HA、维护窗口 | 决定部署和交付方案 |
模型与工作负载:不要只写“部署大模型”
模型名称和参数量只是第一层。企业实际选型还需要明确模型版本、精度、上下文和业务功能。对于MoE模型,还要区分总参数与激活参数;对于视觉或Agent任务,还要说明图像/视频、工具调用、RAG或代码执行等额外链路。
- 如果模型尚未最终确定,可列出1~3个候选模型,并明确希望PoC验证的业务任务。
- 如果使用量化模型,应写清量化格式和来源,不要只写“INT4”;不同实现的算子支持和质量可能不同。
- 如果需要训练或微调,应说明全参数、LoRA/QLoRA、数据规模、序列长度、全局Batch和目标训练周期。
- 如果是RAG/Agent,应把Embedding、Reranker、向量库、文档解析或代码执行等CPU/存储负载一起计入。
并发与SLA:如何把“100个人用”变成可计算输入
“100个用户”和“100并发”不是同一个概念。容量规划更需要请求到达率、同时在途请求数、输入/输出长度分布以及响应目标。
| 原始说法 | 需要继续追问 | 更可用于规划的表达 |
|---|---|---|
| 100个人使用 | 是否同时使用?峰值每分钟多少请求? | 峰值到达率 + 典型在途并发 |
| 要求响应快 | 首字要多快?生成过程是否要流式? | TTFT、TPOT/ITL、端到端时延目标 |
| 支持128K | 常用请求是否真的到128K? | 典型/P95/最大输入长度 |
| 吞吐越高越好 | 吞吐增长能否以明显尾延迟换取? | SLA约束下的最大稳定吞吐 |
如果业务尚未上线没有真实数据,可以先给出低/中/高三档流量假设,在PoC中跑容量曲线,再用实测修正。
数据与存储:容量、带宽和共享方式要分开填
- 模型与镜像:统计模型权重、多个版本、容器镜像和编译缓存;多节点还要考虑分发与回滚。
- 训练数据:记录数据集总量、文件数量、平均文件大小、预处理和Checkpoint写入方式。
- RAG与Agent:除原始文档外,还可能有解析中间文件、索引、数据库、代码仓库和日志。
- 共享需求:本地NVMe适合节点级高带宽工作集,共享存储适合多节点共享、统一数据管理和持久化;两者经常组合使用。
存储配置不应只写“需要20TB”。同样20TB,如果是数亿小文件训练、连续大文件流式读取或模型加载,性能瓶颈完全不同。
机房条件:定GPU之前就应该确认
| 检查项 | 需要确认 | 常见影响 |
|---|---|---|
| 机柜 | 可用U位、深度、承重、导轨空间 | 高密度GPU服务器可能对深度/重量有要求 |
| 供电 | 机柜可用功率、电压、回路、PDU插座/规格、冗余方式 | 决定高功耗服务器数量和电源接入 |
| 散热 | 风冷/液冷条件、冷热通道、机房可承载热密度 | 决定可部署设备形态与密度 |
| 网络 | 上联端口、交换机、光模块/线缆、IB/RoCE需求 | 影响多节点和存储带宽 |
| 管理 | BMC网络、带外管理、安全区和远程运维 | 影响交付、监控和故障处理 |
服务器“电源额定瓦数相加”不能直接视为长期IT负载;正式机柜规划应以整机厂商的系统功耗规格、实际配置、供电冗余和设施设计要求核算。
一张需求表最终应该输出什么
- 工作负载画像:明确模型、精度、请求长度、并发/训练规模。
- 容量假设:给出显存、CPU内存、存储和网络的计算依据以及不确定项。
- 候选架构:单机多卡、HGX/PCIe平台或多节点集群的1~2种可验证方案。
- PoC计划:用目标模型、目标框架和真实任务验证性能、质量、稳定性及资源峰值。
- 机房与扩展检查:确认当前可落地,并为计划期内扩展保留接口。
这样,采购询价就从“按卡报价”变成了一个可验证的工程需求,后续出现配置差异时也能追溯到具体业务假设。
赋创可以在项目中提供哪些支持
赋创可结合客户的目标模型、业务任务、现有软硬件环境和机房条件,协助梳理需求、形成候选AI服务器/集群方案,并在目标环境中完成软硬件适配、PoC基线、容量与稳定性验证。涉及性能与资源数量时,以明确测试条件和实测结果为依据,不把单一理论峰值或厂商公开样例直接等同于客户生产配置。
FAQ|常见问题
采购AI服务器一定要先确定GPU型号吗?
不一定。更稳妥的顺序是先确定模型、任务、精度、上下文、并发和SLA,再筛选满足容量与生态条件的GPU与整机平台。
只有用户数,没有并发数据怎么办?
可以先建立低/中/高三档流量假设,并通过业务原型或API日志逐步收集请求到达率和同时在途请求数,再用PoC容量曲线修正。
显存能装下模型就代表配置够了吗?
不代表。还要为KV Cache或其他运行时状态、框架工作区、通信缓冲和请求波动留空间,同时验证性能和稳定性。
机房功率应该什么时候确认?
应在锁定高密度GPU服务器配置前确认。供电、PDU、散热和机柜条件可能直接限制可部署服务器数量与形态。
需求表填完后可以直接确定采购数量吗?
需求表用于形成容量假设和候选方案;对于大模型、多卡或国产GPU等复杂项目,最终数量仍建议通过目标环境PoC校准。
方案咨询
需要把方案落到实际配置?
联系赋创获取算力、软件栈和交付路径建议。