概念对比

TFLOPS、PFLOPS与TOPS区别:AI芯片算力指标与换算指南

解释TFLOPS、PFLOPS、TOPS的定义与换算,说明FP32、BF16、FP8、FP4、INT8及Dense/Sparse口径为何不能混比,并给出AI芯片理论算力的正确阅读方法。

TFLOPSPFLOPSTOPSFLOPSAI算力GPU算力FP8稀疏算力
Slug
tflops-pflops-tops-ai-compute-metrics
更新
2026-08-06
来源
4
关系
3

先给结论

TFLOPS、PFLOPS和TOPS首先是“单位/口径”,不是脱离精度与运算类型就能直接比较的性能结论。FLOPS表示每秒浮点运算次数,TOPS表示每秒万亿次operations;T与P分别是10<sup>12</sup>和10<sup>15</sup>的十进制数量级,因此1 PFLOPS = 1000 TFLOPS。

  • 先看运算类型:FP32、BF16、FP8、FP4、INT8对应的数据格式不同,不能只比较数字大小。
  • 再看Dense/Sparse:部分厂商规格会把满足特定结构化稀疏条件的峰值单列,不能与稠密峰值混用。
  • 最后看测试条件:理论峰值只描述硬件上限,真实模型还受显存、带宽、互联、算子效率、Batch和软件栈影响。

TFLOPS、PFLOPS、TOPS分别表示什么

指标含义常见使用场景阅读时必须补充的信息
FLOPSFloating-point Operations Per Second,每秒浮点运算次数HPC、训练、推理中的浮点计算FP64/FP32/TF32/BF16/FP16/FP8/FP4等精度
TFLOPS10<sup>12</sup> FLOPS单卡/单芯片浮点峰值常见单位精度、Tensor/Core路径、Dense/Sparse
PFLOPS10<sup>15</sup> FLOPS高端单卡低精度峰值或多卡系统总算力单卡还是系统、卡数、精度、稀疏口径
TOPS10<sup>12</sup> Operations Per SecondAI推理芯片、NPU及INT8等规格中常见operation定义、数据类型、是否稀疏

“OP”比“FLOP”更宽泛。TOPS不能天然理解为“整数算力”,但在AI硬件产品页中经常用于INT8等整数或特定AI运算。因此比较前必须回到厂商对operation和数据格式的具体定义。

为什么同一颗AI芯片会有很多个“算力”

同一硬件在不同数据格式下可使用不同执行路径,理论峰值也会不同。NVIDIA H100官方规格就分别给出FP64、FP32、TF32、BF16/FP16、FP8以及INT8等口径;这意味着“这张卡有多少TFLOPS”本身不是一个完整问题。

精度/格式常见关注点是否可与其他精度直接比峰值
FP64科学计算、高精度HPC否;应在FP64口径内比较
FP32 / TF32通用浮点与Tensor计算;TF32并不等同于传统FP32路径否;先确认计算路径与厂商口径
BF16 / FP16大模型训练与推理常见可在相同精度、相同Dense/Sparse条件下参考
FP8 / FP4低精度训练/推理,依赖硬件与软件支持不能用固定倍率从BF16推导,按目标芯片官方规格和模型实测判断
INT8量化推理等场景通常以OPS/TOPS等口径出现,不能直接与浮点FLOPS混比

关键点:“FP8一定是BF16的2倍、FP4一定是FP8的2倍”不是跨芯片通用定律。某些架构在对应Tensor运算上的理论峰值可能呈现这种倍率,但具体倍率由硬件实现、数据格式与厂商规格决定。

Dense与Sparse:为什么同一规格有时又差一倍

Dense(稠密)按完整矩阵参与运算;Sparse(稀疏)规格则依赖硬件能够跳过满足规则的零元素。以NVIDIA Ampere/Hopper的结构化稀疏为例,官方资料要求特定的2:4模式:每连续4个值中至少2个为0,相关Sparse Tensor Core路径才具备对应加速条件。

NVIDIA DGX B200官方规格明确把部分Tensor Core性能标注为“sparse | dense”,并说明某些只展示sparse的项目,其dense为所示稀疏规格的一半。这个“2倍”来自该产品对指定结构化稀疏模式的规格口径,不能推广为“任何稀疏模型都会自动获得2倍真实性能”

  • 模型权重必须满足目标硬件/库支持的稀疏模式;普通零值并不自动等同于可加速的结构化稀疏。
  • 即使算子达到更高理论吞吐,端到端模型仍可能受内存、通信、调度或非稀疏算子限制。
  • 产品表中若只写一个大数字,应先查脚注确认它是Dense还是Sparse。

TFLOPS、PFLOPS、EFLOPS怎么换算

  • 1 TFLOPS = 10^12 FLOPS
  • 1 PFLOPS = 10^15 FLOPS = 1000 TFLOPS
  • 1 EFLOPS = 10^18 FLOPS = 1000 PFLOPS

例如某系统的FP8理论峰值写成1 EFLOPS,只能表示该系统在厂商定义的FP8计算口径下达到10<sup>18</sup> FLOPS量级;它不能直接推出BF16、FP32性能,也不能直接推出某个LLM的tokens/s。

比较两款AI芯片算力,建议按这6步

  1. 先统一对象:比较单芯片、单卡、单服务器还是整套集群,不能把单卡和系统总算力放在一列。
  2. 统一精度:FP8对FP8、BF16对BF16;若精度不同,必须说明模型质量与数值格式差异。
  3. 统一Dense/Sparse:把稠密峰值与稠密峰值比较;稀疏值必须写明稀疏条件。
  4. 确认计算路径:区分通用标量/向量核心与Tensor/矩阵核心的峰值口径。
  5. 再看容量与数据移动:显存容量、显存带宽、GPU互联和跨节点网络决定计算单元能否持续吃到数据。
  6. 最后用目标模型验证:同模型、同精度、同输入输出长度、同并发和同服务SLA下做端到端PoC。

理论算力为什么不能直接换算成tokens/s

理论峰值描述的是特定运算条件下的硬件上限。LLM推理还包含权重读取、KV Cache访问、Attention/MoE等算子、跨卡通信、CPU调度和框架开销。Prefill往往更容易体现矩阵计算能力;Decode在较小Batch时常更受显存容量与带宽、KV Cache访问和调度影响,但具体瓶颈仍取决于模型与服务配置。

因此,采购或PoC时应把理论算力作为候选方案筛选指标,而不是直接当成业务性能。最终应关注目标SLA下的TTFT、TPOT、吞吐、并发容量、稳定性以及单位业务成本。

赋创可以在项目中提供哪些支持

赋创可结合客户的目标模型、业务任务、现有软硬件环境和机房条件,协助把公开规格转化为可验证的AI服务器/集群候选方案,并通过模型适配、容量计算、软硬件兼容与PoC确认最终边界。涉及性能、卡数、并发或迁移收益时,以明确测试条件和实测结果为依据,不把理论峰值、路线图或厂商样例直接等同于客户生产配置。

FAQ|常见问题

TFLOPS和TOPS可以直接换算吗?

不能在不知道operation定义与数据类型的情况下直接换算。TFLOPS明确指浮点运算;TOPS是更宽泛的operations口径,产品中常用于INT8等AI运算。必须先统一数据格式和运算定义。

1 PFLOPS等于多少TFLOPS?

按SI十进制前缀,1 PFLOPS = 1000 TFLOPS,1 EFLOPS = 1000 PFLOPS。

FP8算力一定是BF16的2倍吗?

不一定。倍率由具体芯片架构、Tensor/矩阵单元、数据格式与厂商定义决定,不能跨产品用固定倍数推导。

稀疏算力为什么经常比稠密算力高?

支持结构化稀疏的硬件可跳过满足特定模式的零元素,从而提高理论有效运算吞吐。但模型必须满足对应稀疏规则,端到端性能也不会必然按理论倍率提升。

理论TFLOPS更高的GPU,LLM推理一定更快吗?

不一定。LLM性能还受显存容量/带宽、互联、模型结构、Batch、KV Cache、软件栈和服务SLA影响,应使用目标模型在统一条件下实测。

方案咨询

需要把方案落到实际配置?

联系赋创获取算力、软件栈和交付路径建议。

咨询方案浏览指南