AI Infrastructure Knowledge Hub

指南 / inference

3 个条目

inference3
指南

多模型并发部署如何做GPU资源隔离

多模型并发部署需要同时约束显存、计算、故障域和服务等级。本文用隔离等级、准入台账和干扰测试说明整卡、MIG与共享调度的选择方法。

推理框架 2026-07-20
GPU资源隔离多模型并发部署MIGGPU共享
指南

大模型推理精度与量化怎么选:BF16、FP8、INT8与INT4

本文从数值格式、量化方式、GPU与推理框架支持、理论权重容量、KV Cache、性能压测和质量回归等维度,说明BF16、FP8、INT8与INT4的适用边界,并给出企业大模型推理部署的选型与验收方法。

推理框架 2026-07-17
大模型量化BF16FP16FP8