对比AI 硬件

TPU、GPU、LPU、ASIC、NPU区别及主流AI芯片选型指南

GPU、TPU、LPU、ASIC和NPU并非完全平行的五类芯片:ASIC是设计类别,TPU是Google的专用AI ASIC产品线,LPU是Groq的厂商架构名称,NPU是神经网络加速器的功能性称呼,GPU则是高度可编程的并行处理器。选型需要同时考虑模型支持、精度、内存、软件栈、部署方式和成本。

AI芯片GPUTPULPUASICNPUAI加速器芯片选型大模型部署
Slug
tpu-gpu-lpu-asic-npu-ai-chip-comparison
更新
2026-07-22
来源
5
关系
3

GPU、TPU、LPU、ASIC 和 NPU 经常被放在同一张 AI 芯片对比表中,但它们并不处于完全相同的分类层级。ASIC 是面向特定应用设计的集成电路类别;TPU、LPU和多数NPU通常都可以视为特定形态的专用AI芯片。GPU则以高度并行、可编程和通用软件生态见长。

因此,五个名称并非互斥。一颗芯片可以同时被称为 ASIC、AI 加速器和 NPU;Google TPU 官方也明确将 TPU 定义为 Google 为机器学习设计的 ASIC。从广义半导体定义看,GPU 本身也是针对特定计算类型设计的集成电路;行业在讨论“GPU 与 AI ASIC”时,通常用 ASIC 狭义指代 GPU 之外、面向更特定 AI 负载定制的加速器。理解这一语境后,再比较性能与产品才不会产生概念混淆。

一、五类名称的准确定位

名称 准确定位 主要特点 典型获取方式
GPU 高度并行、可编程的处理器类别 适配训练、微调、推理和HPC,框架与算子生态成熟 PCIe/OAM/SXM服务器、整机、集群或云实例
TPU Google 自研的机器学习专用 ASIC 产品线 面向矩阵运算和大规模机器学习,强调芯片、互连与XLA软件栈协同 主要通过 Google Cloud TPU 和 Google 自有基础设施使用
LPU Groq 使用的 Language Processing Unit 产品与架构名称 通过编译器静态调度、片上 SRAM 和确定性执行优化低延迟推理 GroqCloud、公有/私有/联合云服务及相应系统方案
ASIC Application-Specific Integrated Circuit,专用集成电路 针对特定负载进行硬件与软件协同设计,效率高但生态和通用性差异很大 云厂商实例、厂商内部集群、专用设备或定制系统
NPU Neural Processing Unit,神经网络处理器的功能性称呼 针对张量、向量和神经网络算子优化,覆盖数据中心、PC、移动和边缘设备 服务器加速卡、SoC内置单元、AI PC、边缘计算设备或云实例

二、GPU:覆盖训练与推理的通用并行平台

GPU 最初面向图形并行计算,随后通过通用计算接口、矩阵/张量运算单元和高带宽显存扩展到 AI 与 HPC。GPU 的核心优势不是只支持某一种模型,而是具备较强的可编程性,以及覆盖编译器、算子库、通信库、推理框架和集群管理的完整生态。

在大模型场景中,GPU 可用于数据处理、预训练、全参数微调、LoRA/QLoRA、在线推理、向量计算和科学计算。NVIDIA 主要依托 CUDA、cuDNN、NCCL 和 TensorRT-LLM 等软件栈;AMD Instinct 主要依托 ROCm 及相关通信和推理组件。

主流产品

  • NVIDIA:H100、H200、B200,以及基于这些 GPU 的 HGX、DGX 和 NVL 系统;
  • AMD:Instinct MI300X、MI325X,以及 MI350P、MI350X、MI355X 等 MI350 系列产品。

GPU 平台的实际性能取决于精度、显存容量与带宽、卡间互连、算子效率和软件版本。不同厂商公布的 TFLOPS/TOPS 只有在数据类型、稀疏条件和测试方法一致时才具有直接可比性。

三、TPU:Google的机器学习专用ASIC

TPU(Tensor Processing Unit)是 Google 自研的机器学习专用 ASIC。Google Cloud 文档将 TPU 定义为用于加速机器学习负载的 ASIC,其设计重点是高效执行矩阵运算,并通过高带宽内存、芯片间互连和 Pod 级扩展支持大规模训练与推理。

TPU 常与 XLA、JAX、TensorFlow 和 PyTorch/XLA 配合使用。当前公开产品包括 TPU v5e、v5p、TPU v6e(Trillium)以及 TPU7x(Ironwood)。其中 v6e 面向 Transformer、图像生成、卷积网络的训练、微调和服务;Ironwood 为后续一代 Cloud TPU 平台。

TPU 的优势来自软硬件协同和集群规模,但它主要通过 Google Cloud 交付,并不是企业常规采购后安装到通用 x86 服务器中的 PCIe 加速卡。迁移前应验证模型算子、编译链、分布式策略和运维体系是否适配 XLA/TPU 环境。

四、LPU:Groq面向推理的专用架构

LPU(Language Processing Unit)是 Groq 使用的产品与架构名称,不是与 GPU、CPU 一样由多家厂商共同采用的通用行业分类。Groq 官方将其定位为面向 AI 推理的专用处理器。

Groq LPU 采用编译器主导的静态调度、单核架构和片上 SRAM,强调可预测执行和持续 token 生成。其价值主要体现在受支持模型的低延迟与稳定响应,而不是替代所有训练平台。是否适合项目,需要核对目标模型、上下文、批处理、精度、API能力和私有化交付方式。

当前主要通过 GroqCloud 以及公有、私有或联合云形态使用 LPU 资源。对后端开发而言,接入方式更接近专用推理服务或系统平台,而不是直接在现有 CUDA 服务器中替换一张 GPU。

五、ASIC:面向特定应用的上层芯片类别

ASIC 指为特定应用设计的集成电路。它描述的是设计目标和定制程度,不代表一种统一的指令集、软件接口或性能水平。不同 AI ASIC 之间的架构、内存、互连、编译器和支持模型可能完全不同。

典型 AI ASIC 或定制加速器包括:

  • Google TPU:用于 Google Cloud 和 Google 内部机器学习平台;
  • AWS Trainium:面向训练及大规模 AI 计算,通过 EC2 和 AWS Neuron 软件栈使用;
  • AWS Inferentia / Inferentia2:面向深度学习和生成式 AI 推理,通过 Inf1/Inf2 实例使用;
  • Microsoft Maia:面向 Azure AI 工作负载的自研加速器,Maia 200 重点面向推理;
  • Meta MTIA:Meta 面向自身推荐、排序和 AI 工作负载建设的内部加速器;
  • Groq LPU:从半导体分类看也属于面向 AI 推理的专用芯片。

ASIC 往往能在目标负载上获得更好的能效或成本结构,但模型支持和迁移成本由各自软件栈决定。对企业而言,选择某种 ASIC 通常也意味着选择对应云平台、编译器、运行时和运维体系。

六、NPU:从数据中心到端侧的神经网络加速器

NPU 是 Neural Processing Unit 的缩写,通常指针对卷积、矩阵乘法、向量计算、激活函数和 Transformer 等神经网络算子优化的处理单元。它是功能性称呼,覆盖范围比单一产品线更广。

数据中心 NPU 注重大模型训练、推理和集群扩展;PC、移动和边缘 NPU 更重视低功耗、低延迟和本地数据处理。两者都叫 NPU,但性能等级、内存系统和软件栈不能直接类比。

主流产品与平台

  • 数据中心:华为昇腾系列 AI 处理器与 Atlas 计算平台,配套 CANN、MindIE 和 torch_npu 等软件组件;
  • AI PC:Intel Core Ultra 集成 NPU、AMD Ryzen AI 的 XDNA/XDNA 2 NPU;
  • 移动与PC SoC:Qualcomm Snapdragon 平台中的 Hexagon NPU;
  • 其他端侧平台:智能手机、摄像头、汽车和工业 SoC 中的厂商自研神经网络加速单元。

端侧 NPU 适合视频会议增强、语音、图像、轻量生成式 AI 和持续后台推理,但不能用端侧 TOPS 直接推导数据中心大模型吞吐。数据中心 NPU 的评估则应同时关注设备内存、集群互连、算子覆盖、框架适配和模型迁移工具。

七、核心技术差异对比

维度 GPU TPU Groq LPU 定制AI ASIC NPU
设计目标 通用并行计算、AI与HPC Google机器学习矩阵计算 低延迟、可预测的AI推理 针对某一平台或负载优化 高效执行神经网络算子
可编程性 中到高,依赖XLA生态 面向编译器支持的模型与算子 因产品而异,通常低于通用GPU 因平台而异,端侧通常更受约束
主要任务 训练、微调、推理、HPC 训练、微调、推理 推理 训练、推理、推荐等指定任务 推理为主,部分数据中心平台支持训练
软件栈 CUDA或ROCm,兼容框架广 XLA、JAX、TensorFlow、PyTorch/XLA Groq编译器、Groq API与GroqCloud Neuron、Maia软件栈等厂商专用环境 CANN、OpenVINO、Ryzen AI、Qualcomm AI Runtime等
本地部署 成熟,形态丰富 通常使用Google Cloud 取决于Groq交付形态 取决于厂商,很多仅在云或内部使用 服务器、PC和边缘均有产品
主要约束 采购成本、功耗、散热与集群通信 平台绑定、编译适配和区域容量 模型覆盖、生态和交付方式 迁移成本、工具链与供应范围 算子覆盖、内存规模和平台碎片化

八、主流产品应该如何理解?

厂商/平台 代表产品 分类关系 主要交付形态
NVIDIAH100、H200、B200及HGX/DGX/NVL系统数据中心GPU服务器、整机、集群、云实例
AMDInstinct MI300X、MI325X、MI350系列数据中心GPU服务器、平台、集群、云实例
Google CloudTPU v5e/v5p、v6e Trillium、TPU7x IronwoodTPU,同时属于AI ASICGoogle Cloud TPU
GroqGroq LPU与GroqCloudLPU,同时属于专用AI芯片云服务、私有或联合云方案
AWSTrainium、Inferentia/Inferentia2定制AI ASICEC2 Trn/Inf实例及AWS服务
MicrosoftMaia 100、Maia 200定制AI加速器/ASICAzure基础设施与服务
MetaMTIA系列定制AI ASIC主要用于Meta内部基础设施
华为昇腾AI处理器、Atlas计算平台数据中心NPU/AI加速器服务器、集群、云与行业平台
Intel / AMD / QualcommCore Ultra NPU、Ryzen AI NPU、Hexagon NPUPC或端侧NPU集成于CPU/SoC和终端设备

“主流”不等于所有产品都可直接采购。GPU 和部分数据中心 NPU 具有较成熟的本地服务器交付形态;TPU、AWS AI 芯片和 Maia 等更依赖对应云平台;Meta MTIA 主要用于厂商内部。技术选型前应先确认资源获取方式。

九、不同AI工作负载如何选择?

1. 大模型预训练与全参数微调

优先评估 GPU 或 TPU。重点检查低精度训练能力、高带宽内存、卡间互连、集合通信、框架稳定性和故障恢复。AWS Trainium 等定制 ASIC 也可用于训练,但通常与特定云平台和软件栈绑定。

2. 企业私有化推理

GPU 和数据中心 NPU 是常见本地部署路径。选择时按模型权重、KV Cache、并发、上下文、延迟和精度验证显存与吞吐,并评估 CUDA/ROCm/CANN 等软件生态的成熟度。

3. 高吞吐云端推理

可同时测试 GPU、Groq LPU、AWS Inferentia、TPU 和其他云端专用加速器。评估指标应统一为相同模型、精度、输入输出长度和质量约束下的首 token 延迟、token 间延迟、吞吐、可用性与单位成本。

4. AI PC、移动与边缘推理

优先评估 NPU,并与集成 GPU、CPU 形成异构调度。需要确认 ONNX、OpenVINO、DirectML、Ryzen AI、Qualcomm AI Runtime 或厂商 SDK 的模型转换和算子支持情况。

5. 需要快速迭代的新模型

GPU 通常具有更广的框架和自定义算子支持。专用芯片也在持续扩大模型覆盖,但上线前应完成编译、精度回归、算子回退和动态形状测试。

十、AI芯片选型的六项检查

  1. 模型支持:目标模型、算子、MoE架构、多模态组件和自定义算子是否可运行;
  2. 精度支持:BF16、FP16、FP8、INT8、INT4等精度是否为硬件原生支持,量化后是否通过精度验证;
  3. 内存与互连:单设备内存、内存带宽、卡间互连和跨节点网络能否满足模型并行;
  4. 软件生态:框架、编译器、驱动、容器、监控、Kubernetes调度和推理引擎是否成熟;
  5. 服务指标:在统一输入输出长度下测试首 token 延迟、token 间延迟、吞吐、并发和稳定性;
  6. 交付与成本:确认本地采购、云资源、区域可用性、授权、迁移成本、能耗和扩容路径。

十一、赋创能提供哪些支持?

赋创可围绕实际模型、框架和部署方式,对可落地的 GPU、NPU 及异构计算平台进行兼容性与容量评估,并结合加速卡、CPU、系统内存、存储、网络和散热完成服务器或集群规划。对于云端专用加速器,也可从模型迁移、接口接入和性能口径出发,与本地部署方案进行同条件验证,帮助客户确定更符合业务约束的算力路径。

FAQ|关于TPU、GPU、LPU、ASIC与NPU的常见问题

1. TPU一定比GPU快吗?

不能脱离工作负载判断。TPU 在适配良好的 XLA/JAX/TensorFlow/PyTorch-XLA 工作负载上具有优势;GPU 在模型覆盖、自定义算子和本地部署方面更灵活。应使用同模型、同精度和同服务目标实测。

2. LPU是通用行业标准名称吗?

目前不是。LPU主要指Groq的Language Processing Unit及其推理架构,不应将所有语言模型加速器都称为LPU。

3. NPU就是国产GPU吗?

不是。NPU是神经网络处理器的功能性称呼,既包括数据中心AI加速器,也包括Intel、AMD和Qualcomm等平台中的端侧NPU。GPU则是另一类高度可编程的并行处理器。

4. TPU、LPU和NPU是否也属于ASIC?

很多情况下是。TPU官方明确属于ASIC;Groq LPU和多数NPU也属于面向特定AI负载设计的专用芯片。行业讨论中将ASIC单列,通常是为了指代未使用GPU、TPU或NPU品牌名称的定制加速器。

5. 同一个PyTorch模型能直接运行在所有芯片上吗?

通常需要对应后端、编译器或转换工具。即使框架接口兼容,也要验证算子覆盖、动态形状、精度、分布式通信和性能;接口可运行不代表已经达到生产性能。

6. 企业本地部署通常优先考虑哪类芯片?

GPU和具备本地交付能力的数据中心NPU最常见,因为服务器、驱动、框架和运维工具相对完整。TPU及部分云厂商ASIC主要通过对应云服务使用。

7. 不同芯片的TOPS可以直接比较吗?

只有在数据类型、稀疏条件、频率、功耗和统计口径一致时才有参考价值。实际选型还应比较内存容量与带宽、模型利用率、延迟、吞吐和软件成熟度。

方案咨询

需要把方案落到实际配置?

联系赋创获取算力、软件栈和交付路径建议。

咨询方案浏览指南