指南推理框架

大模型推理精度与量化怎么选:BF16、FP8、INT8与INT4

本文从数值格式、量化方式、GPU与推理框架支持、理论权重容量、KV Cache、性能压测和质量回归等维度,说明BF16、FP8、INT8与INT4的适用边界,并给出企业大模型推理部署的选型与验收方法。

大模型量化BF16FP16FP8INT8INT4模型部署推理优化GPU服务器KV Cache
Slug
llm-quantization-bf16-fp8-int8-int4
更新
2026-07-17
来源
5
关系
5

先给结论:BF16、FP8、INT8与INT4怎么选

大模型推理中的精度选择,不能简单理解为位数越低越好。BF16或FP16通常用于建立高精度基线;FP8适合硬件与推理后端具备明确支持的场景;INT8适合在资源占用、兼容性与模型质量之间寻找平衡;INT4主要用于缓解权重显存和内存带宽压力,但对量化方法、模型结构和推理内核更敏感。

企业部署时,应先固定模型版本、提示模板、评价数据和服务环境,再比较不同精度。位宽降低意味着可表示的数值集合更稀疏,动态范围和数值精度还取决于指数、尾数、缩放方式及量化粒度。低位宽不等于端到端一定更快,也不等于模型质量一定能够满足生产要求。

精度或方案 优先考虑的场景 主要价值 主要约束
BF16 / FP16 高精度基线、兼容性优先的推理、训练与微调 便于建立可复现的质量参照和回退路径 权重、激活和KV Cache占用通常高于低位宽方案
FP8 Hopper、Blackwell等平台上,目标后端明确支持的高吞吐推理 在保留浮点结构的同时降低权重或激活存储与计算开销 依赖GPU架构、缩放策略、模型支持、内核覆盖和框架版本
INT8 希望降低资源占用,同时控制模型质量风险的生产推理 可采用权重量化或W8A8等路径,适用实现相对丰富 需核对校准数据、离群值处理、计算精度和后端内核
INT4 显存受限、权重搬运或内存带宽压力突出的推理 进一步压缩权重容量,适合以权重为主要瓶颈的场景 对量化方法、分组粒度、模型质量和硬件内核更敏感

快速判断:先看四个条件

  • 质量和兼容性优先:先使用BF16、FP16或模型官方推荐的高精度版本建立基线。
  • 新一代GPU且框架路径明确:可将FP8作为PoC候选,但要核对模型、GPU和推理后端的实际支持。
  • 希望兼顾压缩与部署成熟度:可评估INT8,并明确是权重量化还是权重与激活同时量化。
  • 显存明显不足:可评估INT4权重量化,同时保留高精度回退模型和任务级质量门禁。

长上下文和高并发场景还要单独评估KV Cache。权重量化不会自动改变KV Cache精度,最终显存仍取决于上下文长度、并发、批处理、KV Cache格式和运行时工作区。

先区分数值格式、量化方法与计算路径

BF16、FP16和FP8是浮点数值格式,INT8和INT4是整数低精度表示。部署方案不能只写一个位宽,还要说明量化对象、计算精度、量化粒度、校准方式、模型格式和运行后端。

  • W8A8:权重与激活均采用8位路径,能否加速取决于硬件和推理内核。
  • W4A16:权重压缩到4位,激活或主要计算路径保留16位,常用于降低权重显存和带宽压力。
  • W4A8:权重与激活采用不同低精度组合,支持情况更依赖具体模型和后端。
  • PTQ:模型训练完成后执行量化,部署成本相对可控,但仍需代表性数据进行校准或质量验证。
  • QAT:训练过程中模拟量化误差,可能改善低位宽下的模型质量,但会增加训练和维护成本。

同为INT4,AWQ、GPTQ、分组大小、对称或非对称量化、计算精度和推理后端不同,最终模型质量、显存和性能也可能不同。生产记录中不应只保留“INT4模型”这一项。

BF16与FP16:建立可复现的高精度基线

BF16和FP16都使用16位存储,但指数和尾数分配不同。BF16保留与FP32相同数量的指数位,动态范围更接近FP32;FP16尾数位更多,但动态范围更窄。具体选择应以模型官方建议、GPU支持和推理框架实现为准。

量化项目应先确认高精度模型能够正确加载,输出质量满足业务要求,框架、算子和并行路径完整,再比较FP8、INT8或INT4。没有可复现的高精度基线,低精度结果就缺少可解释的参照。

高精度基线不代表所有权重、激活、累加和通信都固定为同一种精度。验收时仍需记录模型版本、框架版本、混合精度策略和关键算子的实际执行路径。

FP8:重点核对硬件、缩放策略与内核覆盖

FP8常见格式包括E4M3和E5M2。E4M3具有更多尾数位,偏向有效精度;E5M2具有更多指数位,偏向动态范围。实际方案还可能采用per-tensor、per-channel或block scaling等不同缩放方式。<sup>[1]</sup>

选择FP8前,应确认目标GPU、模型架构和推理框架是否具有匹配的权重、激活或KV Cache路径。不能把“模型文件是FP8”直接等同于全部算子都以FP8执行,也不能将硬件支持直接等同于当前框架和当前模型已经支持。

如果部署后端缺少匹配内核,类型转换、反量化或算子回退可能抵消收益。因此,FP8 PoC需要同时观察算子回退、GPU利用率、峰值显存、首Token时延、单Token生成时延和端到端吞吐。

INT8:先明确量化对象和校准方法

INT8可能只压缩权重,也可能让权重和激活都采用8位路径。不同实现对校准数据、离群值、累加精度和未量化模块的处理并不相同。

INT8适合希望降低资源占用,同时将模型质量风险控制在可管理范围内的生产推理。但INT8并不天然优于FP8或INT4,最终效果仍取决于模型、任务、量化方法、硬件和推理后端。

如果后端不支持目标INT8内核,模型可能在加载或运行过程中反量化、转换精度或回退到其他算子。模型文件更小,不代表服务一定更快,应以运行日志和同条件压测判断。

INT4:显存优势必须通过质量门禁

INT4使用4 bit编码量化后的离散值,具体数值范围取决于有符号或无符号表示、对称或非对称量化、缩放因子和零点设置。实际模型还需要分组缩放、量化元数据、未量化层和对齐空间,不能只按每参数0.5字节承诺最终显存。

INT4常见于W4A16等权重量化方案,主要缓解权重容量和显存带宽压力。是否获得性能提升,还取决于打包格式、反量化开销、内核融合、批量大小、GPU架构和服务框架。

INT4对不同模型、层和任务的敏感程度并不一致。企业回归集应覆盖长文本、代码、数学、工具调用、结构化输出及实际业务样本,不能只用少量主观问答判断。

显存估算:理论权重容量只是第一步

稠密模型的理论权重容量可以按“参数量×每参数字节数”进行第一轮估算。以下以70B稠密模型为例,统一使用十进制GB,仅计算理论权重容量。

格式 理论每参数容量 70B模型理论权重容量 未包含的主要开销
BF16 / FP16 约2字节 约140GB 激活、KV Cache、工作区、通信缓冲和显存碎片
FP8 / INT8 约1字节 约70GB 缩放因子、零点、元数据、未量化层和对齐开销
INT4 约0.5字节 约35GB 分组元数据、打包、未量化层和对齐开销

上述结果不能直接作为GPU配置承诺。生产显存还要加入KV Cache、激活、CUDA或其他运行时工作区、通信缓冲、图捕获、并发批次和内存碎片。对于MoE模型,权重存储通常取决于总参数量,单Token计算负载则还要考虑激活参数量,两者不能混为一谈。

六步完成企业量化选型

  1. 冻结目标:明确是离线推理还是在线服务,并记录模型质量、时延、吞吐、并发、上下文和成本目标。
  2. 建立高精度基线:固定模型、分词器、提示模板、解码参数、评价数据和运行环境。
  3. 核对兼容矩阵:确认GPU、驱动、容器、推理框架、量化后端、模型架构、算子和并行方式。
  4. 选择候选方案:框架路径明确时评估FP8;希望兼顾压缩和质量时评估INT8;显存压力突出时评估INT4。
  5. 完成质量与性能回归:在相同条件下比较业务质量、峰值显存、TTFT、TPOT、吞吐、P95/P99、错误率和稳定性。
  6. 保留回退路径:保存高精度模型、量化配置、构建工具版本、测试结果和回退流程。

PoC与生产验收要检查什么

验收维度 必须固定的条件 建议保留的证据
正确性 模型、分词器、提示模板和解码参数 回归集、失败样本和输出差异记录
质量 业务任务、评价指标、容差和人工复核规则 高精度基线与候选精度对照结果
显存 上下文长度、并发、批处理和KV Cache精度 峰值显存、稳定区间和OOM边界
性能 输入输出长度分布、并发、硬件和框架版本 TTFT、TPOT、吞吐、P95/P99和错误率
兼容性 GPU、驱动、容器、推理框架和量化后端 版本清单、启动日志和算子回退记录
稳定性 测试时长、故障条件、监控和恢复流程 长稳日志、告警、重启和回退记录

量化会如何影响AI服务器配置

  • GPU:优先核对原生低精度能力、显存容量和推理框架内核,不只比较理论算力。
  • CPU与内存:模型转换、加载、CPU卸载和多进程服务可能增加主机内存及数据搬运压力。
  • 存储:建议保留原始模型、量化模型、校准数据、量化配置和回归报告,并做好版本管理。
  • 多GPU互联:量化不会自动消除跨卡通信,张量并行和专家并行仍需核对通信路径。
  • 运维:监控中应记录模型精度、量化方法、后端版本和回退状态,避免不同实例口径漂移。

常见错误

  • 只写“INT4模型”,不说明AWQ、GPTQ、分组大小、计算精度和推理后端。
  • 使用模型文件大小代替运行显存,忽略KV Cache、激活、工作区和并发批次。
  • 跨GPU、跨框架直接比较速度,没有固定输入输出分布和并发条件。
  • 看到硬件支持某种精度,就默认当前模型和服务框架已经具有匹配内核。
  • 只看通用榜单,不检查企业自己的长文本、代码、数学、工具调用或结构化输出。
  • 量化后没有保留高精度模型、量化工具、构建配置和可执行回退路径。

赋创可以提供哪些支持

赋创可从AI算力基础设施和系统工程角度,协助完成目标模型与推理框架的兼容性核对、GPU服务器配置、容器与软件栈部署、量化方案运行环境搭建、同条件性能压测及交付验收。

模型业务质量指标、回归数据集和上线标准应由客户算法或业务团队确认。赋创可配合执行测试、记录结果并结合显存、吞吐、时延和稳定性数据,协助确定适合实际环境的服务器与部署方案。

常见问题

位数越低,推理一定越快吗?

不一定。端到端性能取决于GPU是否具有目标低精度路径、推理框架是否提供匹配内核,以及反量化、类型转换、批处理、内存带宽和算子回退开销。

为什么还要考虑FP16?

FP16仍是常见的高精度推理和混合精度格式。BF16与FP16的动态范围和有效精度不同,具体选择应以模型官方建议、GPU支持和推理框架实现为准。本页将两者共同作为高精度基线,但不代表二者可以无条件互换。

FP8和INT8应该怎么选?

如果GPU和推理后端对FP8有明确支持,可以将FP8作为PoC候选;如果目标硬件和框架的INT8路径更成熟,也可以优先评估INT8。两者没有脱离模型、硬件和后端的固定优劣,最终应以同条件PoC决定。

INT4一定会明显降低模型质量吗?

不能一概而论。影响取决于模型结构、量化方法、分组粒度、校准数据、未量化模块和目标任务。必须与高精度基线进行任务级回归。

权重量化后,KV Cache会自动变小吗?

不会自动发生。KV Cache精度是需要单独核对的运行配置,并受推理框架、模型、上下文长度和硬件支持影响。部分后端支持独立设置FP8等KV Cache格式。

没有业务回归集,可以直接选择INT4上线吗?

不建议。没有业务回归集就无法判断低位宽对关键任务的影响。至少应准备覆盖真实输入分布、长文本、结构化输出和典型失败场景的测试集,再决定是否进入生产。

方案咨询

需要把方案落到实际配置?

联系赋创获取算力、软件栈和交付路径建议。

咨询方案浏览指南