GLM-5 系列模型是什么?从 744B MoE、稀疏注意力到长时程 Agentic Engineering
GLM-5 系列不只是一次参数规模升级。本文从 744B-A40B MoE、DeepSeek Sparse Attention、异步强化学习,到 GLM-5.1 的长时程 Agent 能力和 GLM-5.2 的 1M Context、IndexShare 与 MTP,解释这一系列技术变化如何把模型能力从单轮生成进一步推向 Agentic Engineering。
赋创 AI 知识平台FUCHUANG AI Infrastructure Platform
AI Infrastructure Knowledge Hub
9 个概念条目
GLM-5 系列不只是一次参数规模升级。本文从 744B-A40B MoE、DeepSeek Sparse Attention、异步强化学习,到 GLM-5.1 的长时程 Agent 能力和 GLM-5.2 的 1M Context、IndexShare 与 MTP,解释这一系列技术变化如何把模型能力从单轮生成进一步推向 Agentic Engineering。
本页从承载网络、远程内存访问、RoCE地址标识和GPU扩展互联四个层级解释ETH、RDMA、GID与NVLink,并提供场景判断表、拓扑核查清单和PoC验收方法。
从模型权重、许可证、数据边界、定制能力、部署成本和算力需求等维度,对比开源大模型与闭源大模型的核心区别,并给出企业API、自托管及混合部署的选型方法。
解释TFLOPS、PFLOPS、TOPS的定义与换算,说明FP32、BF16、FP8、FP4、INT8及Dense/Sparse口径为何不能混比,并给出AI芯片理论算力的正确阅读方法。
LLM智能体架构定义模型、工具、状态、记忆和控制循环的组织方式。本文说明单Agent与多Agent模式、顺序、并行、交接和动态编排,以及企业部署中的安全、成本、评估和基础设施要求。
主动学习不是一种独立模型,而是一套“模型选样—人工标注—重新训练—效果评估”的人在回路(Human-in-the-loop)机制。它的目标不是单纯减少标注数量,而是在满足业务质量、合规与交付周期的前提下,提高每单位标注成本带来的模型收益。
7B、13B、70B和671B表示模型参数规模,但参数量不能单独决定模型能力、推理速度或服务器配置。判断部署需求时,还要区分稠密与MoE架构,并结合权重精度、上下文长度、并发、KV Cache和推理框架计算实际资源。
本文从动态范围、有效精度、存储格式、计算格式、累加精度、缩放方式和硬件支持出发,说明FP64、FP32、TF32、BF16、FP16、FP8、INT8、INT4与NVFP4的区别,并给出科学计算、大模型训练和推理部署中的判断方法。帮助AI服务器、科学计算和大模型部署人员理解不同数值精度的结构、计算路径及适用边界,避免仅按位宽判断显存、性能和模型质量。
PCIe 是连接 CPU、GPU、网卡和存储的通用高速总线,NVLink 是 NVIDIA 面向 GPU 间高速通信的专用互联。本文说明两者的带宽、拓扑、多卡显存、适用任务与服务器选型边界。