概念训练 / 微调

模型参数解密:7B、13B、70B、671B 意味着什么

7B、13B、70B和671B表示模型参数规模,但参数量不能单独决定模型能力、推理速度或服务器配置。判断部署需求时,还要区分稠密与MoE架构,并结合权重精度、上下文长度、并发、KV Cache和推理框架计算实际资源。

大模型参数量7B模型13B模型70B模型671B模型MoE显存计算大模型部署
Slug
llm-parameter-count-7b-13b-70b-671b
更新
2026-07-22
来源
6
关系
5

模型名称中的 7B、13B、70B、671B,通常表示参数量约为 70 亿、130 亿、700 亿和 6710 亿。这里的 B 是 billion,即十亿。参数是模型在训练过程中学习得到的数值,包括注意力层、前馈网络、词嵌入和归一化层等结构中的权重。

参数量首先反映模型的存储规模和计算规模,但不能直接等同于模型能力,也不能直接换算成固定的 GPU 数量。同样是 70B,不同架构、训练数据、上下文长度、量化方式和推理框架,实际效果与硬件需求都可能明显不同。

一、7B、13B、70B与671B的核心区别

参数规模 换算 常见架构示例 部署层面的主要含义
7B 约 70 亿参数 Llama 2 7B 等稠密模型 适合单卡原型、轻量知识问答、信息抽取和边缘侧实验;较容易在消费级或工作站级 GPU 上部署。
13B 约 130 亿参数 Llama 2 13B 等稠密模型 相较 7B 有更高的权重容量和计算量;BF16/FP16 部署通常需要更大显存,24GB 显存多采用量化方案。
70B 约 700 亿参数 Llama 2 70B、Llama 3.x 70B 等稠密模型 通常进入多卡部署范围;长上下文、高并发和生产级服务会进一步增加显存、互连与系统内存需求。
671B 约 6710 亿总参数 DeepSeek-V3 / DeepSeek-R1 代表性的 MoE 规模 不能按 671B 稠密模型理解。DeepSeek-V3 为 671B 总参数、每个 token 激活约 37B 参数,但完整权重仍需要在分布式系统中存放。

表中的型号用于解释参数口径,不表示所有 7B、13B、70B 或 671B 模型都采用相同架构,也不表示相同规模的模型具有相同能力。

二、模型参数量实际表示什么?

对 Transformer 类大模型而言,参数量主要由隐藏维度、层数、注意力结构、前馈网络维度、词表规模以及专家数量等因素决定。参数量增大通常意味着模型可以容纳更多可学习权重,但最终能力还取决于:

  • 模型架构,包括注意力机制、前馈网络、MoE 路由和位置编码设计;
  • 预训练数据的规模、质量、去重和配比;
  • 训练计算量是否与参数规模匹配;
  • 指令微调、强化学习、蒸馏和其他后训练方法;
  • 评测任务、提示方式、上下文长度和推理策略。

因此,参数更多不等于在所有任务上都更强。小模型经过高质量训练或针对特定领域优化后,可能在目标任务上优于更大的通用模型。

三、先区分稠密模型与MoE模型

1. 稠密模型

稠密模型在每次前向计算中通常会使用模型主体的大部分参数。以 70B 稠密模型为例,每个 token 的计算都会经过各层注意力和前馈网络。参数量、权重内存和每 token 计算量之间的关系相对直观。

2. MoE模型

MoE(Mixture of Experts,混合专家)模型在部分层中配置多个专家网络,由路由器为每个 token 选择其中少量专家参与计算。总参数量反映所有专家和共享模块的规模,激活参数量反映单个 token 实际参与计算的参数规模。

DeepSeek-V3 官方资料给出的口径是 671B 总参数、每个 token 激活约 37B 参数。这意味着它的每 token 计算量并不等同于 671B 稠密模型,但也不能据此认为部署时只需装入 37B 权重。未被当前 token 选中的专家仍要为其他 token 保持可用,完整模型通常需要跨多卡或多节点存放。

DeepSeek 官方仓库还注明:主模型权重为 671B,公开模型文件另外包含约 14B 的多 Token 预测模块,完整文件口径可达到 685B。评估下载空间和模型加载空间时,应以具体版本的模型卡和权重清单为准。

四、参数量如何换算为权重内存?

只计算模型权重时,可以使用以下理论公式:

权重内存 ≈ 参数量 × 每个参数占用的字节数

参数规模 FP32(4字节) BF16 / FP16(2字节) 8 bit(1字节) 4 bit(0.5字节)
7B约 28 GB约 14 GB约 7 GB约 3.5 GB
13B约 52 GB约 26 GB约 13 GB约 6.5 GB
70B约 280 GB约 140 GB约 70 GB约 35 GB
671B约 2.684 TB约 1.342 TB约 671 GB约 335.5 GB

以上是十进制理论值,只计算权重本身。4 bit 和 8 bit 模型通常还包含分组量化的 scale、zero point、索引、未量化层以及文件格式开销,实际占用会高于简单乘法结果。操作系统和 GPU 工具常以 GiB 展示容量,与十进制 GB 也存在差异。

五、为什么权重能放下,运行时仍然会显存不足?

推理服务的 GPU 显存不只保存权重,还要容纳以下内容:

  • KV Cache:保存已处理 token 的 Key 和 Value,随上下文长度、并发请求数、层数、KV 头数量、头维度和数据精度增长;
  • 临时激活与算子工作区:用于矩阵运算、注意力计算、通信和内核执行;
  • 推理框架开销:包括内存池、CUDA Graph、编译缓存和调度结构;
  • 并行通信缓冲区:张量并行、流水线并行、专家并行和跨节点通信会预留额外空间;
  • 内存碎片与安全余量:已分配显存不一定都能被连续有效利用。

同一个 70B 模型,单用户短上下文测试与多用户长上下文服务的 KV Cache 可能相差数倍甚至更多。因此,生产配置应从目标并发、输入长度、输出长度和服务等级反推,而不是只按权重文件大小配置显存。

六、推理、微调和训练的内存口径不同

任务 主要内存组成 对参数量的敏感程度
推理 模型权重、KV Cache、临时激活、算子工作区和通信缓冲区 权重内存与总参数量直接相关;长上下文和高并发可能使 KV Cache 成为主要增量。
LoRA / QLoRA微调 基础模型权重、适配器参数、部分梯度、优化器状态和激活 可显著减少可训练参数和优化器状态,但基础模型仍需加载,激活内存仍受批次和序列长度影响。
全参数微调 / 预训练 权重、梯度、优化器状态、主权重副本、激活和通信缓冲区 远高于推理内存;ZeRO/FSDP、张量并行、流水线并行、激活重计算和卸载策略会改变单卡占用。

训练内存不能用“参数量 × 2 字节”估算。优化器类型、混合精度策略、参数分片方式和激活保存策略不同,每参数对应的状态开销也不同。

七、不同参数规模如何规划部署?

规模 初步资源判断 适合优先验证的场景
7B BF16 权重理论值约 14GB。单张 24GB GPU 通常可进行基础推理验证;更长上下文或更高并发需要额外余量。 原型开发、分类抽取、轻量 RAG、单用户或低并发助手。
13B BF16 权重理论值约 26GB。24GB GPU 通常采用 8 bit 或 4 bit 量化;原生半精度更适合 40GB/48GB 及以上显存或多卡方案。 更复杂的通用问答、代码辅助、领域模型验证。
70B BF16 权重理论值约 140GB,通常使用多张高显存 GPU。4 bit 权重理论值约 35GB,但单张 48GB 卡用于长上下文或并发服务时余量可能不足。 高质量私有化推理、复杂 Agent、企业级知识服务和专业任务。
671B MoE 即使按 8 bit 计算,主模型权重理论值也约 671GB;通常需要多卡、多节点及高速互连。37B 激活参数降低的是每 token 计算量,并非完整权重容量。 大规模通用推理、复杂推理与代码任务、集群级服务。

实际项目应先明确模型版本、精度、最大上下文、并发、吞吐和延迟目标,再验证推理框架支持情况。模型能启动只是第一步,生产部署还要评估首 token 延迟、生成速度、峰值显存、稳定性、故障恢复和扩容方式。

八、常见理解偏差

  1. 把参数量等同于模型文件大小:文件大小还受精度、量化格式、分片方式和附加模块影响。
  2. 把MoE激活参数等同于部署参数:激活参数主要描述每 token 计算路径,完整专家权重仍需可访问。
  3. 用参数量直接判断模型效果:架构、数据、训练和后训练同样决定能力。
  4. 用权重内存直接确定GPU数量:还需为 KV Cache、框架、通信和并发留出空间。
  5. 把上下文长度当作参数量:参数量是模型权重规模,上下文长度是单次处理的 token 上限,两者不是同一指标。

九、赋创能提供哪些支持?

赋创可根据客户的模型版本、精度、上下文长度、并发和延迟目标,完成权重内存与 KV Cache 估算,并结合 GPU 显存、卡间互连、CPU、系统内存、NVMe 存储和网络规划单机或集群方案。对于 7B 至 70B 稠密模型以及更大规模的 MoE 模型,可进一步开展框架适配、量化验证、性能测试和扩容边界评估,使配置与实际业务负载保持一致。

FAQ|关于大模型参数量的常见问题

1. 7B中的B是什么意思?

B 是 billion,即十亿。7B 通常表示模型约有 70 亿个参数。

2. 70B模型一定比13B模型效果好吗?

不一定。相同模型家族和训练条件下,更大规模通常具有更高容量,但跨模型比较还要看架构、数据、后训练方法和具体任务。

3. 671B总参数、37B激活参数是什么意思?

这是 MoE 模型的两种口径。671B 是全部专家与共享模块的总参数,37B 是单个 token 前向计算时大约参与运算的参数量。部署仍需让完整权重在系统中可访问。

4. 为什么不能只根据参数量确定GPU数量?

GPU 数量还取决于权重精度、KV Cache、上下文长度、并发、框架开销、并行策略和单卡显存。相同模型在开发测试和生产服务中的配置可能完全不同。

5. 4 bit量化会把显存严格降到BF16的四分之一吗?

不会严格等于四分之一。量化权重本体接近这一比例,但 scale、zero point、未量化层、KV Cache和框架工作区不会同步按四分之一缩小。

6. 权重已经装入显存,为什么生成长文本时仍会OOM?

生成过程中 KV Cache 会随上下文和并发增长,临时激活与工作区也会占用显存。权重能装入不代表运行时有足够余量。

7. 参数量和上下文长度有什么关系?

参数量描述模型权重规模,上下文长度描述一次请求可处理的 token 数。两者相互独立,但更长上下文会增加推理内存和计算负载。

方案咨询

需要把方案落到实际配置?

联系赋创获取算力、软件栈和交付路径建议。

咨询方案浏览指南