TFLOPS、PFLOPS与TOPS区别:AI芯片算力指标与换算指南
解释TFLOPS、PFLOPS、TOPS的定义与换算,说明FP32、BF16、FP8、FP4、INT8及Dense/Sparse口径为何不能混比,并给出AI芯片理论算力的正确阅读方法。
- Slug
tflops-pflops-tops-ai-compute-metrics- 更新
- 2026-08-06
- 来源
- 4
- 关系
- 3
先给结论
TFLOPS、PFLOPS和TOPS首先是“单位/口径”,不是脱离精度与运算类型就能直接比较的性能结论。FLOPS表示每秒浮点运算次数,TOPS表示每秒万亿次operations;T与P分别是10<sup>12</sup>和10<sup>15</sup>的十进制数量级,因此1 PFLOPS = 1000 TFLOPS。
- 先看运算类型:FP32、BF16、FP8、FP4、INT8对应的数据格式不同,不能只比较数字大小。
- 再看Dense/Sparse:部分厂商规格会把满足特定结构化稀疏条件的峰值单列,不能与稠密峰值混用。
- 最后看测试条件:理论峰值只描述硬件上限,真实模型还受显存、带宽、互联、算子效率、Batch和软件栈影响。
TFLOPS、PFLOPS、TOPS分别表示什么
| 指标 | 含义 | 常见使用场景 | 阅读时必须补充的信息 |
|---|---|---|---|
| FLOPS | Floating-point Operations Per Second,每秒浮点运算次数 | HPC、训练、推理中的浮点计算 | FP64/FP32/TF32/BF16/FP16/FP8/FP4等精度 |
| TFLOPS | 10<sup>12</sup> FLOPS | 单卡/单芯片浮点峰值常见单位 | 精度、Tensor/Core路径、Dense/Sparse |
| PFLOPS | 10<sup>15</sup> FLOPS | 高端单卡低精度峰值或多卡系统总算力 | 单卡还是系统、卡数、精度、稀疏口径 |
| TOPS | 10<sup>12</sup> Operations Per Second | AI推理芯片、NPU及INT8等规格中常见 | operation定义、数据类型、是否稀疏 |
“OP”比“FLOP”更宽泛。TOPS不能天然理解为“整数算力”,但在AI硬件产品页中经常用于INT8等整数或特定AI运算。因此比较前必须回到厂商对operation和数据格式的具体定义。
为什么同一颗AI芯片会有很多个“算力”
同一硬件在不同数据格式下可使用不同执行路径,理论峰值也会不同。NVIDIA H100官方规格就分别给出FP64、FP32、TF32、BF16/FP16、FP8以及INT8等口径;这意味着“这张卡有多少TFLOPS”本身不是一个完整问题。
| 精度/格式 | 常见关注点 | 是否可与其他精度直接比峰值 |
|---|---|---|
| FP64 | 科学计算、高精度HPC | 否;应在FP64口径内比较 |
| FP32 / TF32 | 通用浮点与Tensor计算;TF32并不等同于传统FP32路径 | 否;先确认计算路径与厂商口径 |
| BF16 / FP16 | 大模型训练与推理常见 | 可在相同精度、相同Dense/Sparse条件下参考 |
| FP8 / FP4 | 低精度训练/推理,依赖硬件与软件支持 | 不能用固定倍率从BF16推导,按目标芯片官方规格和模型实测判断 |
| INT8 | 量化推理等场景 | 通常以OPS/TOPS等口径出现,不能直接与浮点FLOPS混比 |
关键点:“FP8一定是BF16的2倍、FP4一定是FP8的2倍”不是跨芯片通用定律。某些架构在对应Tensor运算上的理论峰值可能呈现这种倍率,但具体倍率由硬件实现、数据格式与厂商规格决定。
Dense与Sparse:为什么同一规格有时又差一倍
Dense(稠密)按完整矩阵参与运算;Sparse(稀疏)规格则依赖硬件能够跳过满足规则的零元素。以NVIDIA Ampere/Hopper的结构化稀疏为例,官方资料要求特定的2:4模式:每连续4个值中至少2个为0,相关Sparse Tensor Core路径才具备对应加速条件。
NVIDIA DGX B200官方规格明确把部分Tensor Core性能标注为“sparse | dense”,并说明某些只展示sparse的项目,其dense为所示稀疏规格的一半。这个“2倍”来自该产品对指定结构化稀疏模式的规格口径,不能推广为“任何稀疏模型都会自动获得2倍真实性能”。
- 模型权重必须满足目标硬件/库支持的稀疏模式;普通零值并不自动等同于可加速的结构化稀疏。
- 即使算子达到更高理论吞吐,端到端模型仍可能受内存、通信、调度或非稀疏算子限制。
- 产品表中若只写一个大数字,应先查脚注确认它是Dense还是Sparse。
TFLOPS、PFLOPS、EFLOPS怎么换算
- 1 TFLOPS = 10^12 FLOPS
- 1 PFLOPS = 10^15 FLOPS = 1000 TFLOPS
- 1 EFLOPS = 10^18 FLOPS = 1000 PFLOPS
例如某系统的FP8理论峰值写成1 EFLOPS,只能表示该系统在厂商定义的FP8计算口径下达到10<sup>18</sup> FLOPS量级;它不能直接推出BF16、FP32性能,也不能直接推出某个LLM的tokens/s。
比较两款AI芯片算力,建议按这6步
- 先统一对象:比较单芯片、单卡、单服务器还是整套集群,不能把单卡和系统总算力放在一列。
- 统一精度:FP8对FP8、BF16对BF16;若精度不同,必须说明模型质量与数值格式差异。
- 统一Dense/Sparse:把稠密峰值与稠密峰值比较;稀疏值必须写明稀疏条件。
- 确认计算路径:区分通用标量/向量核心与Tensor/矩阵核心的峰值口径。
- 再看容量与数据移动:显存容量、显存带宽、GPU互联和跨节点网络决定计算单元能否持续吃到数据。
- 最后用目标模型验证:同模型、同精度、同输入输出长度、同并发和同服务SLA下做端到端PoC。
理论算力为什么不能直接换算成tokens/s
理论峰值描述的是特定运算条件下的硬件上限。LLM推理还包含权重读取、KV Cache访问、Attention/MoE等算子、跨卡通信、CPU调度和框架开销。Prefill往往更容易体现矩阵计算能力;Decode在较小Batch时常更受显存容量与带宽、KV Cache访问和调度影响,但具体瓶颈仍取决于模型与服务配置。
因此,采购或PoC时应把理论算力作为候选方案筛选指标,而不是直接当成业务性能。最终应关注目标SLA下的TTFT、TPOT、吞吐、并发容量、稳定性以及单位业务成本。
赋创可以在项目中提供哪些支持
赋创可结合客户的目标模型、业务任务、现有软硬件环境和机房条件,协助把公开规格转化为可验证的AI服务器/集群候选方案,并通过模型适配、容量计算、软硬件兼容与PoC确认最终边界。涉及性能、卡数、并发或迁移收益时,以明确测试条件和实测结果为依据,不把理论峰值、路线图或厂商样例直接等同于客户生产配置。
FAQ|常见问题
TFLOPS和TOPS可以直接换算吗?
不能在不知道operation定义与数据类型的情况下直接换算。TFLOPS明确指浮点运算;TOPS是更宽泛的operations口径,产品中常用于INT8等AI运算。必须先统一数据格式和运算定义。
1 PFLOPS等于多少TFLOPS?
按SI十进制前缀,1 PFLOPS = 1000 TFLOPS,1 EFLOPS = 1000 PFLOPS。
FP8算力一定是BF16的2倍吗?
不一定。倍率由具体芯片架构、Tensor/矩阵单元、数据格式与厂商定义决定,不能跨产品用固定倍数推导。
稀疏算力为什么经常比稠密算力高?
支持结构化稀疏的硬件可跳过满足特定模式的零元素,从而提高理论有效运算吞吐。但模型必须满足对应稀疏规则,端到端性能也不会必然按理论倍率提升。
理论TFLOPS更高的GPU,LLM推理一定更快吗?
不一定。LLM性能还受显存容量/带宽、互联、模型结构、Batch、KV Cache、软件栈和服务SLA影响,应使用目标模型在统一条件下实测。
方案咨询
需要把方案落到实际配置?
联系赋创获取算力、软件栈和交付路径建议。