昇腾910B、910C与950区别:芯片、互联与超节点架构
基于华为官方公开资料梳理昇腾910B、910C与950系列的代际变化,重点看低精度格式、内存与互联、Prefill/Decode分工以及Atlas 900/950超节点,并明确路线图与已公开展示状态。
- Slug
ascend-910b-910c-950-differences-superpod- 更新
- 2026-08-06
- 来源
- 3
- 关系
- 4
先给结论
从华为公开路线看,910B/910C到950的变化不只是“单芯片算力增加”,而是低精度数据格式、内存/访存、NPU互联和超节点形态一起升级。其中950系列进一步拆分为面向Prefill/推荐的950PR与面向Decode/训练的950DT。
需要特别区分“已商用/已公开展示”和“路线图目标”。截至2026年8月5日,华为已在WAIC 2026公开展示1024卡昇腾950超节点真机;而2025年发布会公布的8192卡Atlas 950满配规模与Ascend 950DT Q4 2026上市时间仍属于官方路线图口径,不应与当前展示规模混写。
先明确:这类代际对比最重要的是事实边界
昇腾芯片的公开资料颗粒度并不完全一致。华为在2025年公开演讲中系统披露了Ascend 950系列与未来路线,并把910B/910C作为前一代基线;但这不意味着所有910B/910C微架构、核心数量、内存规格和制造信息都能从同一官方来源核验。
因此本文不引用来源不明的“达芬奇核心配比”“甜蜜点”“唯一选择”等二手结论,只比较当前华为公开能够明确支持的代际变化和系统形态。
| 对象 | 截至2026-08-05可确认的官方公开状态 | 本文如何处理 |
|---|---|---|
| Ascend 910B | 华为2025路线演讲把910B/910C作为既有代际,并公布CANN面向910B/C的开源开放计划 | 不补写无法由同一一手来源确认的微架构/显存表 |
| Ascend 910C | 已作为Atlas 900 A3/384超节点的基础芯片规模部署;华为2025演讲给出384卡、最高300 PFLOPS的系统级口径 | 用于说明从芯片到超节点的系统演进,不反推未经官方单列的单芯片规格 |
| Ascend 950系列 | 官方公开950PR/950DT定位、低精度格式、互联与部分内存规格;2026年7月已公开展示昇腾950超节点真机 | 区分当前公开展示与2025路线图中的Q4/满配目标 |
从910B/910C到950,官方明确了哪些变化
华为2025年公开路线给出的核心变化包括:
| 维度 | 910B/910C公开基线 | Ascend 950系列官方公开变化 | 对系统设计的意义 |
|---|---|---|---|
| 编程/计算结构 | 作为前一代昇腾基线 | 引入SIMD/SIMT新同构设计 | 更强调向量/碎片化负载与编程模型 |
| 低精度格式 | 本文不补写未在该路线页统一列出的规格 | 新增FP8、MXFP8、MXFP4等,并支持HiF8;官方给出FP8 1 PFLOPS、FP4 2 PFLOPS | 训练/推理需要重新验证目标低精度格式和算子链 |
| 芯片互联 | 华为未在此处单列绝对值 | 950系列互联带宽达到2TB/s;官方表述为相比910C提升2.5倍 | 更适合把扩展问题放到多NPU/超节点层评估 |
| 内存/访存 | 本文不引用二手统一参数表 | 950DT公开144GB内存容量、4TB/s内存访问带宽 | Decode、训练和长序列负载的容量/带宽边界发生变化 |
| 产品分工 | 910B/910C没有按950方式公开PR/DT双芯片分工 | 950PR面向Prefill/推荐;950DT面向Decode/训练 | 推理系统开始更明确按Prefill/Decode负载特征规划资源 |
这说明950的企业价值判断不能只问“比910C快多少”。更有意义的问题是:目标模型是否使用新增低精度路径、是否受访存/互联限制、Prefill与Decode是否需要不同资源池,以及现有CANN/框架/算子能否平滑迁移。
Ascend 950PR与950DT:官方为什么把Prefill和Decode分开
| 型号 | 官方主要定位 | 官方公开重点 | 资料状态 |
|---|---|---|---|
| Ascend 950PR | 推理Prefill、推荐 | 采用HiBL 1.0;强调计算并行和成本优化 | 2025路线图称计划2026年Q1推出,首批形态为标卡和超节点服务器 |
| Ascend 950DT | 推理Decode、训练 | 144GB、4TB/s访存带宽、2TB/s互联;支持FP8/MXFP8/MXFP4/HiF8 | 2025路线图称计划2026年Q4推出 |
Prefill需要处理输入上下文,通常具有更高矩阵计算密度;Decode逐token生成,对权重/KV读写、访存和并发调度更敏感。华为把950PR与950DT分开设计,体现的是按负载阶段优化系统的思路。项目上是否需要做Prefill/Decode分离部署,则仍取决于模型、并发、时延目标和推理框架,不应仅因芯片命名就直接拆池。
从Atlas 900到Atlas 950:为什么超节点比单卡参数更值得关注
| 时间/产品 | 官方公开信息 | 需要怎样理解 |
|---|---|---|
| 2025:Atlas 900 A3/384 | 384颗Ascend 910C组成超节点,系统最高300 PFLOPS;华为2026年7月更新称384超节点已商用落地750多套 | 910C已进入大规模系统化部署阶段,评价应包含互联、调度和软件 |
| 2025路线图:Atlas 950 | 基于Ascend 950DT,路线图满配8192卡、8 EFLOPS FP8、16 EFLOPS FP4,计划2026年Q4上市 | 这是发布时的未来满配/上市目标,不能当作2026年8月已交付配置 |
| 2026 WAIC:昇腾950超节点真机 | 现场公开展示1024卡集群;1 EFLOPS FP8、2 EFLOPS FP4;256TB全局统一内存编址;官方称TB级NPU互联与3μs RTT | 这是截至核验日更接近当前的公开实机信息,应与8192卡路线图目标分开记录 |
两组950数据并不应该简单判断为“互相矛盾”:2025发布页描述的是规划的Atlas 950满配路线,2026 WAIC页面描述的是当时公开展示的1024卡真机。知识库应保留时间和状态标签,避免把未来路线图写成现货规格。
硬件代际变化之外,CANN和软件生态同样决定迁移成本
华为2025年公开演讲提出CANN编译器与虚拟指令集接口开放,并推进面向910B/C的软件开源开放;2026 WAIC页面进一步公布CANN开源社区与Mind系列基础软件的进展。这意味着企业评估910B/910C到950不能只检查“模型能不能加载”,还需要建立版本与算子矩阵。
- 确认目标CANN、驱动/固件、PyTorch/其他框架和推理引擎的支持组合。
- 验证目标模型的Attention、MoE、量化、自定义算子及长上下文路径。
- 若使用FP8/MXFP8/MXFP4/HiF8等950新增路径,必须做质量回归与性能基线,不能只按理论峰值估算收益。
- 多NPU/超节点场景需要同时验证通信库、并行策略、All-Reduce/All-to-All、故障恢复和监控。
企业项目怎么判断继续用910C、迁移950还是做混合验证
| 项目状态 | 建议优先动作 | 原因 |
|---|---|---|
| 已有910B/910C稳定生产 | 先保留生产基线,再选择关键模型做950兼容/性能PoC | 避免为了追新代际引入不必要的软件迁移风险 |
| 新建国产大模型推理平台 | 把目标模型拆成Prefill/Decode、长上下文、高并发等负载画像,再评估910C与950可用形态 | 950的价值更可能体现在低精度、访存、互联和超节点协同 |
| 训练/MoE多节点项目 | 把互联、网络、通信库、Checkpoint和扩展效率作为核心验收项 | 单卡峰值无法代表系统扩展效率 |
| 计划采用950DT/大规模Atlas 950 | 以项目采购时的正式产品文档、供货状态和兼容矩阵重新核验 | 截至2026-08-05仍存在“路线图目标”与“公开展示真机”两个状态层级 |
对赋创这类AI基础设施项目,比较国产算力平台时更适合把结论落到可获得硬件 + 可复现软件栈 + 目标模型质量/性能 + 多卡扩展 + 机房与运维五个层面,再通过PoC确定最终配置,而不是对单一芯片代际下泛化的“更快/更省”结论。
赋创可以在项目中提供哪些支持
赋创可结合客户的目标模型、业务任务、现有软硬件环境和机房条件,协助把公开规格转化为可验证的AI服务器/集群候选方案,并通过模型适配、容量计算、软硬件兼容与PoC确认最终边界。涉及性能、卡数、并发或迁移收益时,以明确测试条件和实测结果为依据,不把理论峰值、路线图或厂商样例直接等同于客户生产配置。
FAQ|常见问题
昇腾910C相比910B具体提升多少?
公开信息可以确认910C已进入Atlas 900/384超节点规模部署,但若要给出单芯片算力、显存、核心数量等精确代际表,应以对应华为正式产品资料为准。本文不使用二手微架构数据推导固定提升比例。
Ascend 950已经正式大规模商用了吗?
截至2026年8月5日,华为已公开展示1024卡昇腾950超节点真机;2025路线图同时给出950DT与Atlas 950在2026年Q4的上市/满配规划。项目采购时应再次确认正式产品状态和供货信息。
Ascend 950PR和950DT有什么区别?
华为官方将950PR主要定位于Prefill和推荐,950DT主要定位于Decode和训练;950DT公开规格包括144GB内存、4TB/s访存带宽和2TB/s互联,并支持多种低精度格式。
Atlas 950到底是1024卡还是8192卡?
两者对应不同资料状态。2025路线图公布Atlas 950满配目标为8192卡;2026 WAIC公开展示的昇腾950超节点真机为1024卡集群。发布内容必须同时写明时间与“路线图/实机展示”状态。
从910C迁移950只需要更换硬件吗?
不是。还应核验CANN、驱动/固件、框架、推理引擎、量化格式、模型算子、多卡通信和运维工具,并用目标模型做质量与性能回归。
方案咨询
需要把方案落到实际配置?
联系赋创获取算力、软件栈和交付路径建议。