指南推理框架

赋创 FR50D运行Qwen 35B与27B的环境 资源占用与实测记录

赋创 FR50D AI边缘Box运行Qwen3.6-35B、Qwen3.8-27B及部分Qwen3.6-27B量化模型的工程测试记录,包含环境、显存、Prefill、TTFT、Decode、Chat API与部署边界。

赋创 FR50DQwen3.6-35BQwen3.8-27BAI边缘Box本地推理
Slug
fr50d-qwen-35b-27b-local-inference
更新
2026-09-22
来源
4
关系
3

企业评估本地大模型时,需要同时确认模型装载、首Token等待、持续生成、显存占用和应用接口。本文基于赋创 FR50D的一组工程测试记录,整理Qwen 35B与27B量化模型在当前软硬件条件下的运行情况。

本文不进行35B MoE与27B Dense的直接性能排名,也不将单个峰值外推为所有输入长度、并发规模或业务场景的结果。

一 测试目标与产品支持范围

本轮测试主要回答三个问题:35B量化模型能否完成装载、接口调用和持续生成;输入长度变化时TTFT与Prefill如何变化;27B量化模型能否在同一设备环境中完成本地运行。

赋创 FR50D支持Qwen3.6-35B、Qwen3.6-27B及35B以下的系列模型,并全面支持Qwen3.8-27B的本地推理运行。

产品支持范围不等于本文公开的数据范围。本文只展示多轮测试中的一组代表性记录,用于说明模型运行和接口联调情况。

二 测试环境

项目本轮环境
测试平台赋创 FR50D AI边缘Box,双芯,总显存48GB
驱动版本v1.4.3
运行时HLIELLama-xh2 v2.2.0
测试方式单请求工程测试
公开模型Qwen3.6-35B-A3B、Qwen3.8-27B及部分Qwen3.6-27B量化模型

三 Prefill TTFT与Decode的含义

指标对应阶段用于判断
Prefill输入Token处理模型读取提示词和上下文的速度
TTFT请求到首Token返回用户开始看到响应前的等待
Decode逐Token生成回答持续输出阶段的节奏

四 Qwen3.6-35B运行记录

Qwen3.6-35B-A3B使用约35GB的GGUF模型文件,运行显存占用约36.8GB。模型完成了装载、API调用和持续生成。

观察项本轮记录条件说明
Decode约24.6至25.3 tok/s64至512个生成Token的单请求测试
Chat API约21.5至23.6 tok/s问答、解释、创作、分析和代码任务
TTFT262至683ms;4096 Token约1.12s前者对应128至2048 Token输入
Prefill约97.3至673.3 tok/s128至8192 Token输入,最高值出现在1024 Token测试点
温度读数40.5°C升至42.3°C测试期间传感器读数

TTFT和Prefill会随输入长度变化,最高测试点不能代表所有场景。工程评估应使用接近真实业务的输入长度和输出长度重复测试。

五 Qwen 27B运行记录

Qwen3.8-27B Q4_0模型文件约22GB,运行显存占用约27.2GB,测试期间温度传感器读数由42.1°C升至45.6°C。Qwen3.6-27B部分量化模型也完成了基础运行验证。

35B MoE与27B Dense在模型架构、激活参数量和量化方式上并不相同,两组记录只分别说明设备的运行和适配情况。

六 本轮完成的验证环节

在当前模型文件、量化方式和软件环境下,FR50D完成了35B和27B量化模型的装载与运行;35B模型还完成了Chat API调用和多类任务的持续生成。

七 测试边界与部署建议

当前数据以单请求工程测试为主,不能直接外推到高并发、长时间稳定性、整机功耗、噪声或回答质量。面向正式部署,应根据目标并发量、上下文长度、业务数据和持续运行时间单独设计测试。

  • 确认目标模型文件、量化方式和运行时版本。
  • 按照真实业务设置上下文长度和输出长度。
  • 验证目标并发量、排队策略和长时间稳定性。
  • 使用业务数据评估回答质量和应用链路。

八 常见问题

赋创 FR50D支持哪些Qwen模型

赋创 FR50D支持Qwen3.6-35B、Qwen3.6-27B及35B以下的系列模型,并全面支持Qwen3.8-27B的本地推理运行。

约25 tok/s适用于哪些条件

约24.6至25.3 tok/s来自Qwen3.6-35B量化模型在当前软硬件环境下的单请求Decode测试,实际速度会随模型文件、量化方式、输入输出长度、运行时版本和任务类型变化。

工程测试结果能否直接代表正式部署

本轮测试确认模型装载、运行与接口联调可行。正式部署仍需进一步验证并发、上下文长度、持续运行稳定性、模型效果、功耗和应用链路。

下一步验证建议

如需根据具体模型、上下文长度和并发目标评估本地推理方案,可进一步沟通模型适配与工程测试需求。

方案咨询

需要把方案落到实际配置?

根据目标模型、上下文长度和并发规模沟通模型适配与工程测试需求。

咨询方案浏览指南