AI Infrastructure Knowledge Hub

FAQ

27 个FAQ条目

AI 服务器2 AI 软件1 CPU3 FAQ21
FAQ

AI服务器扩容路线:加GPU、加节点还是升级平台?

现有AI服务器算力不够时,先判断瓶颈在显存、计算、互联、PCIe、网络、存储还是机房,再决定加GPU、增加节点或升级整机平台,并通过扩容前后基线验证实际收益。

AI 服务器 2026-08-06
AI服务器扩容GPU服务器扩容GPU集群Scale-up
FAQ

PCIe通道不够会怎样影响多GPU服务器

PCIe通道不足可能使GPU、网卡和NVMe共享上行,影响数据搬运、跨卡通信和扩展效率。本文说明术语、敏感负载、拓扑资料和实机验证方法

AI 服务器 2026-07-20
PCIe通道多GPU服务器PCIe拓扑GPU P2P
FAQ

大模型推理服务器CPU重要吗?

大模型推理主要依赖GPU,但CPU仍负责Tokenization、请求调度、RAG检索、网络和存储I/O。本文说明CPU何时会成为推理瓶颈

CPU 2026-07-07
大模型推理CPUGPU服务器RAG
FAQ

COMSOL GPU加速适用于哪些计算场景?

COMSOL的GPU能力与版本、求解器和模型有关。本文说明COMSOL 6.4的cuDSS、压力声学和多GPU边界,以及GPU服务器选型方法。

AI 软件 2026-07-07
COMSOLCOMSOL 6.4GPU加速cuDSS
FAQ

国产CPU能否搭配NVIDIA GPU

国产CPU可以在部分服务器中搭配NVIDIA GPU,但必须满足PCIe、服务器认证、操作系统、驱动、CUDA和软件生态条件。本文给出项目核验清单。

CPU 2026-07-06
国产CPUNVIDIA GPUAI服务器驱动
FAQ

GPU利用率低是否可能是CPU瓶颈?

GPU利用率低可能与CPU、数据加载、NUMA、存储、网络或框架同步有关。本文提供从主机资源到GPU拓扑的排查顺序。

CPU 2026-07-06
GPU利用率CPU瓶颈性能排查NUMA
问答

14B 模型需要多大显存?

14B 模型所需显存取决于权重精度、量化方式、上下文长度、并发和 KV Cache。本文给出单卡与多卡部署的显存估算方法,并说明开发验证与生产环境的配置差异。

FAQ 2026-06-12
faqLLM14B显存
问答

32B 模型通常需要几张 GPU?

32B 模型需要几张 GPU,取决于显卡显存、模型精度、量化方式、上下文长度和并发目标。本文提供单卡、多卡与生产部署的判断方法,帮助规划合理配置。

FAQ 2026-06-12
faqLLM32BGPU
FAQ

671B 模型私有化部署怎么做

解释 671B 级超大模型私有化部署的工程路径,覆盖权重显存、KV Cache、量化、并行策略、网络、推理框架、机房和验收压测。

FAQ 2026-06-12
faqllm-deployment671bdeepseek
FAQ

部署 DeepSeek-R1-32B 需要什么配置

基于 DeepSeek 官方模型卡与工程估算,说明“DeepSeek-R1-32B”常见部署含义、显存需求区间和推荐服务器配置。

FAQ 2026-06-12
faqdeepseek32bgpu-sizing
FAQ

企业 RAG 的 Embedding 模型怎么选

解释企业 RAG 中 Embedding 模型选型应关注语言覆盖、领域适配、向量维度、检索质量、吞吐、部署成本和与 reranker 的配合。

FAQ 2026-06-12
faqembeddingragsemantic-search
FAQ

企业 RAG 系统算力规格怎么规划?

基于 NVIDIA 对 RAG 工作流的官方定义,说明企业在规划 RAG 算力时为什么必须拆分 Embedding、检索、重排、生成和服务层,而不能只看主模型显存。

FAQ 2026-06-12
faqragsizingembedding
问答

推理和训练服务器有什么区别?

说明训练服务器与推理服务器在目标、硬件重点、架构方式和采购顺序上的差异,帮助企业判断先买哪一类更合适。

FAQ 2026-06-12
faq推理服务器训练服务器AI 部署
问答

AI 项目如何分阶段采购算力?

解释 AI 项目为什么应采用验证期、试点期、上线期、扩展期的分阶段采购策略,而不是一开始就一次性买满。

FAQ 2026-06-12
faqAI 采购算力规划部署选型
FAQ

NVIDIA RTX PRO 6000 适合什么场景

围绕 NVIDIA RTX PRO 6000的3个不同形态版本定位、适用场景、与 L40S/A100/RTX 5090 的差异和部署建议的问答条目。

FAQ 2026-06-12
faqnvidiapro-6000rtx-6000-ada
FAQ

Qwen2.5-72B 推理需要多少显存

基于 Qwen 官方模型卡与工程估算,说明 Qwen2.5-72B 在 BF16/INT8/INT4 场景下的显存需求与推荐 GPU 配置。

FAQ 2026-06-12
faqqwen72bvram
FAQ

RTX 5090 适合大模型部署吗

围绕 RTX 5090 在大模型推理、量化部署、性价比和生产可用性方面的定位与适用边界的问答条目。

FAQ 2026-06-04
faqrtx-5090consumer-gpullm-deployment
问答

70B 模型如何做部署规格规划?

70B 模型部署需综合考虑模型架构、精度、量化、上下文、KV Cache、并发和多卡互联。本文梳理显存估算、GPU 数量、服务器形态及生产部署边界。

FAQ 2026-05-04
faqLLM70B部署规格
问答

7B 模型需要多大显存?

说明 7B 模型在 4-bit、8-bit 与 FP16/BF16 条件下的大致显存需求与部署建议。

FAQ 2026-05-04
faqLLM7B显存
问答

单机部署还是集群部署更合适?

单机与集群部署的选择取决于模型规模、并发、可用性、扩展需求和运维能力。本文对比两种架构的适用场景、成本、性能与实施边界,帮助企业做部署决策。

FAQ 2026-05-04
faq单机部署集群部署AI 架构
问答

企业知识库项目多久能上线?

说明企业知识库 / 私有化 RAG 项目常见的上线周期通常在 4 到 8 周,并解释影响进度的关键因素。

FAQ 2026-05-04
faqRAG知识库项目周期
问答

向量数据库需要 GPU 吗?

向量数据库是否需要 GPU,取决于向量生成、索引构建、检索规模、重排和并发要求。本文说明 CPU 与 GPU 的职责边界,以及 RAG 场景中的合理资源配置方式。

FAQ 2026-05-04
faq向量数据库GPURAG
问答

NVLink 有必要吗?

解释 NVLink 更适合哪些训练与多卡高性能场景,以及为什么很多企业推理项目起步阶段并不必须优先考虑它。

FAQ 2026-05-04
faqNVLinkGPU 互联训练服务器
FAQ

RoCE 和 InfiniBand 怎么选

解释 AI 训练和推理集群中 RoCE/Ethernet 与 InfiniBand 的选型边界,覆盖网络架构、延迟、拥塞控制、运维复杂度和典型适用场景。

FAQ 2026-05-03
faqnetworkingroceinfiniband
FAQ

企业部署大模型要不要液冷

回答企业部署大模型时是否需要液冷,区分少量推理服务器、8-GPU 训练节点、H200/B200 平台和 GB200 机架级系统的不同边界。

FAQ 2026-05-01
faqllm-deploymentliquid-coolinggpu-server
FAQ

vLLM 和 TensorRT-LLM 怎么选

基于 vLLM 和 TensorRT-LLM 官方文档,解释两条主流 LLM 推理栈在模型生态、硬件绑定、性能目标和部署复杂度上的差异。

FAQ 2026-04-20
faqvllmtensorrt-llminference
FAQ

Kimi 长文本模型部署需要什么配置

围绕 Kimi / Moonshot 长文本模型部署的显存需求、上下文长度影响、GPU 选型与超长上下文部署建议的问答条目。

FAQ 2026-04-18
faqkimimoonshotlong-context