模型参数解密:7B、13B、70B、671B 意味着什么
7B、13B、70B和671B表示模型参数规模,但参数量不能单独决定模型能力、推理速度或服务器配置。判断部署需求时,还要区分稠密与MoE架构,并结合权重精度、上下文长度、并发、KV Cache和推理框架计算实际资源。
- Slug
llm-parameter-count-7b-13b-70b-671b- 更新
- 2026-07-22
- 来源
- 6
- 关系
- 5
模型名称中的 7B、13B、70B、671B,通常表示参数量约为 70 亿、130 亿、700 亿和 6710 亿。这里的 B 是 billion,即十亿。参数是模型在训练过程中学习得到的数值,包括注意力层、前馈网络、词嵌入和归一化层等结构中的权重。
参数量首先反映模型的存储规模和计算规模,但不能直接等同于模型能力,也不能直接换算成固定的 GPU 数量。同样是 70B,不同架构、训练数据、上下文长度、量化方式和推理框架,实际效果与硬件需求都可能明显不同。
一、7B、13B、70B与671B的核心区别
| 参数规模 | 换算 | 常见架构示例 | 部署层面的主要含义 |
|---|---|---|---|
| 7B | 约 70 亿参数 | Llama 2 7B 等稠密模型 | 适合单卡原型、轻量知识问答、信息抽取和边缘侧实验;较容易在消费级或工作站级 GPU 上部署。 |
| 13B | 约 130 亿参数 | Llama 2 13B 等稠密模型 | 相较 7B 有更高的权重容量和计算量;BF16/FP16 部署通常需要更大显存,24GB 显存多采用量化方案。 |
| 70B | 约 700 亿参数 | Llama 2 70B、Llama 3.x 70B 等稠密模型 | 通常进入多卡部署范围;长上下文、高并发和生产级服务会进一步增加显存、互连与系统内存需求。 |
| 671B | 约 6710 亿总参数 | DeepSeek-V3 / DeepSeek-R1 代表性的 MoE 规模 | 不能按 671B 稠密模型理解。DeepSeek-V3 为 671B 总参数、每个 token 激活约 37B 参数,但完整权重仍需要在分布式系统中存放。 |
表中的型号用于解释参数口径,不表示所有 7B、13B、70B 或 671B 模型都采用相同架构,也不表示相同规模的模型具有相同能力。
二、模型参数量实际表示什么?
对 Transformer 类大模型而言,参数量主要由隐藏维度、层数、注意力结构、前馈网络维度、词表规模以及专家数量等因素决定。参数量增大通常意味着模型可以容纳更多可学习权重,但最终能力还取决于:
- 模型架构,包括注意力机制、前馈网络、MoE 路由和位置编码设计;
- 预训练数据的规模、质量、去重和配比;
- 训练计算量是否与参数规模匹配;
- 指令微调、强化学习、蒸馏和其他后训练方法;
- 评测任务、提示方式、上下文长度和推理策略。
因此,参数更多不等于在所有任务上都更强。小模型经过高质量训练或针对特定领域优化后,可能在目标任务上优于更大的通用模型。
三、先区分稠密模型与MoE模型
1. 稠密模型
稠密模型在每次前向计算中通常会使用模型主体的大部分参数。以 70B 稠密模型为例,每个 token 的计算都会经过各层注意力和前馈网络。参数量、权重内存和每 token 计算量之间的关系相对直观。
2. MoE模型
MoE(Mixture of Experts,混合专家)模型在部分层中配置多个专家网络,由路由器为每个 token 选择其中少量专家参与计算。总参数量反映所有专家和共享模块的规模,激活参数量反映单个 token 实际参与计算的参数规模。
DeepSeek-V3 官方资料给出的口径是 671B 总参数、每个 token 激活约 37B 参数。这意味着它的每 token 计算量并不等同于 671B 稠密模型,但也不能据此认为部署时只需装入 37B 权重。未被当前 token 选中的专家仍要为其他 token 保持可用,完整模型通常需要跨多卡或多节点存放。
DeepSeek 官方仓库还注明:主模型权重为 671B,公开模型文件另外包含约 14B 的多 Token 预测模块,完整文件口径可达到 685B。评估下载空间和模型加载空间时,应以具体版本的模型卡和权重清单为准。
四、参数量如何换算为权重内存?
只计算模型权重时,可以使用以下理论公式:
权重内存 ≈ 参数量 × 每个参数占用的字节数
| 参数规模 | FP32(4字节) | BF16 / FP16(2字节) | 8 bit(1字节) | 4 bit(0.5字节) |
|---|---|---|---|---|
| 7B | 约 28 GB | 约 14 GB | 约 7 GB | 约 3.5 GB |
| 13B | 约 52 GB | 约 26 GB | 约 13 GB | 约 6.5 GB |
| 70B | 约 280 GB | 约 140 GB | 约 70 GB | 约 35 GB |
| 671B | 约 2.684 TB | 约 1.342 TB | 约 671 GB | 约 335.5 GB |
以上是十进制理论值,只计算权重本身。4 bit 和 8 bit 模型通常还包含分组量化的 scale、zero point、索引、未量化层以及文件格式开销,实际占用会高于简单乘法结果。操作系统和 GPU 工具常以 GiB 展示容量,与十进制 GB 也存在差异。
五、为什么权重能放下,运行时仍然会显存不足?
推理服务的 GPU 显存不只保存权重,还要容纳以下内容:
- KV Cache:保存已处理 token 的 Key 和 Value,随上下文长度、并发请求数、层数、KV 头数量、头维度和数据精度增长;
- 临时激活与算子工作区:用于矩阵运算、注意力计算、通信和内核执行;
- 推理框架开销:包括内存池、CUDA Graph、编译缓存和调度结构;
- 并行通信缓冲区:张量并行、流水线并行、专家并行和跨节点通信会预留额外空间;
- 内存碎片与安全余量:已分配显存不一定都能被连续有效利用。
同一个 70B 模型,单用户短上下文测试与多用户长上下文服务的 KV Cache 可能相差数倍甚至更多。因此,生产配置应从目标并发、输入长度、输出长度和服务等级反推,而不是只按权重文件大小配置显存。
六、推理、微调和训练的内存口径不同
| 任务 | 主要内存组成 | 对参数量的敏感程度 |
|---|---|---|
| 推理 | 模型权重、KV Cache、临时激活、算子工作区和通信缓冲区 | 权重内存与总参数量直接相关;长上下文和高并发可能使 KV Cache 成为主要增量。 |
| LoRA / QLoRA微调 | 基础模型权重、适配器参数、部分梯度、优化器状态和激活 | 可显著减少可训练参数和优化器状态,但基础模型仍需加载,激活内存仍受批次和序列长度影响。 |
| 全参数微调 / 预训练 | 权重、梯度、优化器状态、主权重副本、激活和通信缓冲区 | 远高于推理内存;ZeRO/FSDP、张量并行、流水线并行、激活重计算和卸载策略会改变单卡占用。 |
训练内存不能用“参数量 × 2 字节”估算。优化器类型、混合精度策略、参数分片方式和激活保存策略不同,每参数对应的状态开销也不同。
七、不同参数规模如何规划部署?
| 规模 | 初步资源判断 | 适合优先验证的场景 |
|---|---|---|
| 7B | BF16 权重理论值约 14GB。单张 24GB GPU 通常可进行基础推理验证;更长上下文或更高并发需要额外余量。 | 原型开发、分类抽取、轻量 RAG、单用户或低并发助手。 |
| 13B | BF16 权重理论值约 26GB。24GB GPU 通常采用 8 bit 或 4 bit 量化;原生半精度更适合 40GB/48GB 及以上显存或多卡方案。 | 更复杂的通用问答、代码辅助、领域模型验证。 |
| 70B | BF16 权重理论值约 140GB,通常使用多张高显存 GPU。4 bit 权重理论值约 35GB,但单张 48GB 卡用于长上下文或并发服务时余量可能不足。 | 高质量私有化推理、复杂 Agent、企业级知识服务和专业任务。 |
| 671B MoE | 即使按 8 bit 计算,主模型权重理论值也约 671GB;通常需要多卡、多节点及高速互连。37B 激活参数降低的是每 token 计算量,并非完整权重容量。 | 大规模通用推理、复杂推理与代码任务、集群级服务。 |
实际项目应先明确模型版本、精度、最大上下文、并发、吞吐和延迟目标,再验证推理框架支持情况。模型能启动只是第一步,生产部署还要评估首 token 延迟、生成速度、峰值显存、稳定性、故障恢复和扩容方式。
八、常见理解偏差
- 把参数量等同于模型文件大小:文件大小还受精度、量化格式、分片方式和附加模块影响。
- 把MoE激活参数等同于部署参数:激活参数主要描述每 token 计算路径,完整专家权重仍需可访问。
- 用参数量直接判断模型效果:架构、数据、训练和后训练同样决定能力。
- 用权重内存直接确定GPU数量:还需为 KV Cache、框架、通信和并发留出空间。
- 把上下文长度当作参数量:参数量是模型权重规模,上下文长度是单次处理的 token 上限,两者不是同一指标。
九、赋创能提供哪些支持?
赋创可根据客户的模型版本、精度、上下文长度、并发和延迟目标,完成权重内存与 KV Cache 估算,并结合 GPU 显存、卡间互连、CPU、系统内存、NVMe 存储和网络规划单机或集群方案。对于 7B 至 70B 稠密模型以及更大规模的 MoE 模型,可进一步开展框架适配、量化验证、性能测试和扩容边界评估,使配置与实际业务负载保持一致。
FAQ|关于大模型参数量的常见问题
1. 7B中的B是什么意思?
B 是 billion,即十亿。7B 通常表示模型约有 70 亿个参数。
2. 70B模型一定比13B模型效果好吗?
不一定。相同模型家族和训练条件下,更大规模通常具有更高容量,但跨模型比较还要看架构、数据、后训练方法和具体任务。
3. 671B总参数、37B激活参数是什么意思?
这是 MoE 模型的两种口径。671B 是全部专家与共享模块的总参数,37B 是单个 token 前向计算时大约参与运算的参数量。部署仍需让完整权重在系统中可访问。
4. 为什么不能只根据参数量确定GPU数量?
GPU 数量还取决于权重精度、KV Cache、上下文长度、并发、框架开销、并行策略和单卡显存。相同模型在开发测试和生产服务中的配置可能完全不同。
5. 4 bit量化会把显存严格降到BF16的四分之一吗?
不会严格等于四分之一。量化权重本体接近这一比例,但 scale、zero point、未量化层、KV Cache和框架工作区不会同步按四分之一缩小。
6. 权重已经装入显存,为什么生成长文本时仍会OOM?
生成过程中 KV Cache 会随上下文和并发增长,临时激活与工作区也会占用显存。权重能装入不代表运行时有足够余量。
7. 参数量和上下文长度有什么关系?
参数量描述模型权重规模,上下文长度描述一次请求可处理的 token 数。两者相互独立,但更长上下文会增加推理内存和计算负载。
方案咨询
需要把方案落到实际配置?
联系赋创获取算力、软件栈和交付路径建议。