赋创 FR50D运行Qwen 35B与27B的环境 资源占用与实测记录
赋创 FR50D AI边缘Box运行Qwen3.6-35B、Qwen3.8-27B及部分Qwen3.6-27B量化模型的工程测试记录,包含环境、显存、Prefill、TTFT、Decode、Chat API与部署边界。
- Slug
fr50d-qwen-35b-27b-local-inference- 更新
- 2026-09-22
- 来源
- 4
- 关系
- 3
企业评估本地大模型时,需要同时确认模型装载、首Token等待、持续生成、显存占用和应用接口。本文基于赋创 FR50D的一组工程测试记录,整理Qwen 35B与27B量化模型在当前软硬件条件下的运行情况。
本文不进行35B MoE与27B Dense的直接性能排名,也不将单个峰值外推为所有输入长度、并发规模或业务场景的结果。
一 测试目标与产品支持范围
本轮测试主要回答三个问题:35B量化模型能否完成装载、接口调用和持续生成;输入长度变化时TTFT与Prefill如何变化;27B量化模型能否在同一设备环境中完成本地运行。
赋创 FR50D支持Qwen3.6-35B、Qwen3.6-27B及35B以下的系列模型,并全面支持Qwen3.8-27B的本地推理运行。
产品支持范围不等于本文公开的数据范围。本文只展示多轮测试中的一组代表性记录,用于说明模型运行和接口联调情况。
二 测试环境
| 项目 | 本轮环境 |
|---|---|
| 测试平台 | 赋创 FR50D AI边缘Box,双芯,总显存48GB |
| 驱动版本 | v1.4.3 |
| 运行时 | HLIELLama-xh2 v2.2.0 |
| 测试方式 | 单请求工程测试 |
| 公开模型 | Qwen3.6-35B-A3B、Qwen3.8-27B及部分Qwen3.6-27B量化模型 |
三 Prefill TTFT与Decode的含义
| 指标 | 对应阶段 | 用于判断 |
|---|---|---|
| Prefill | 输入Token处理 | 模型读取提示词和上下文的速度 |
| TTFT | 请求到首Token返回 | 用户开始看到响应前的等待 |
| Decode | 逐Token生成 | 回答持续输出阶段的节奏 |
四 Qwen3.6-35B运行记录
Qwen3.6-35B-A3B使用约35GB的GGUF模型文件,运行显存占用约36.8GB。模型完成了装载、API调用和持续生成。
| 观察项 | 本轮记录 | 条件说明 |
|---|---|---|
| Decode | 约24.6至25.3 tok/s | 64至512个生成Token的单请求测试 |
| Chat API | 约21.5至23.6 tok/s | 问答、解释、创作、分析和代码任务 |
| TTFT | 262至683ms;4096 Token约1.12s | 前者对应128至2048 Token输入 |
| Prefill | 约97.3至673.3 tok/s | 128至8192 Token输入,最高值出现在1024 Token测试点 |
| 温度读数 | 40.5°C升至42.3°C | 测试期间传感器读数 |
TTFT和Prefill会随输入长度变化,最高测试点不能代表所有场景。工程评估应使用接近真实业务的输入长度和输出长度重复测试。
五 Qwen 27B运行记录
Qwen3.8-27B Q4_0模型文件约22GB,运行显存占用约27.2GB,测试期间温度传感器读数由42.1°C升至45.6°C。Qwen3.6-27B部分量化模型也完成了基础运行验证。
35B MoE与27B Dense在模型架构、激活参数量和量化方式上并不相同,两组记录只分别说明设备的运行和适配情况。
六 本轮完成的验证环节
在当前模型文件、量化方式和软件环境下,FR50D完成了35B和27B量化模型的装载与运行;35B模型还完成了Chat API调用和多类任务的持续生成。
七 测试边界与部署建议
当前数据以单请求工程测试为主,不能直接外推到高并发、长时间稳定性、整机功耗、噪声或回答质量。面向正式部署,应根据目标并发量、上下文长度、业务数据和持续运行时间单独设计测试。
- 确认目标模型文件、量化方式和运行时版本。
- 按照真实业务设置上下文长度和输出长度。
- 验证目标并发量、排队策略和长时间稳定性。
- 使用业务数据评估回答质量和应用链路。
八 常见问题
赋创 FR50D支持哪些Qwen模型
赋创 FR50D支持Qwen3.6-35B、Qwen3.6-27B及35B以下的系列模型,并全面支持Qwen3.8-27B的本地推理运行。
约25 tok/s适用于哪些条件
约24.6至25.3 tok/s来自Qwen3.6-35B量化模型在当前软硬件环境下的单请求Decode测试,实际速度会随模型文件、量化方式、输入输出长度、运行时版本和任务类型变化。
工程测试结果能否直接代表正式部署
本轮测试确认模型装载、运行与接口联调可行。正式部署仍需进一步验证并发、上下文长度、持续运行稳定性、模型效果、功耗和应用链路。
下一步验证建议
如需根据具体模型、上下文长度和并发目标评估本地推理方案,可进一步沟通模型适配与工程测试需求。
方案咨询
需要把方案落到实际配置?
根据目标模型、上下文长度和并发规模沟通模型适配与工程测试需求。