对某网站用8G显存部署Qwen3.6-35B-A3B文章的评估与本地部署实测报告

摘要:本文对某网站一篇宣称"用8G显卡本地部署Qwen3.6-35B-A3B模型,实现128K上下文稳定40 token/s输出"的技术文章进行全面评估。通过模型文件核实、命令参数验证、硬件需求对比和本机实测,发现文章在技术名词层面基本属实,但在硬件门槛和性能数据上存在严重夸大与错误。实测表明,8GB显存无法运行该模型,官方推荐的4-bit量化方案需要24GB显存起步。文章提供了可行的调整方案和量化选择建议,帮助读者根据实际硬件配置合理部署。

整理日期:2026-07-31
评估对象:某网站文章,用8G显卡本地部署运行qwen3.6 35B大模型,128K长上下文稳定高速输出
实测硬件:GPU: NVIDIA RTX 4060 (8 GB VRAM), RAM: 16 GB, CPU: Intel i7-14650HX (16C/24T), OS: Windows 11, llama.cpp: 版本 b10182
使用工具:CCB[https://github.com/claude-code-best/claude-code.git]+MiniMax-M3[1m]


目录

  1. 文章基本信息
  2. 文章核心内容摘要
  3. 事实核实
  4. 本机实测
  5. 真实性最终评估
  6. 解决方案与建议
  7. 参考资料

一、文章核心内容摘要

某网站文章的核心论点 : 用 8 GB 显卡即可在本地流畅跑 35B MoE 模型,推理速度稳定 40 token/s

1.1 模型与量化

  • 模型:Qwen3.6-35B-A3B(稀疏 MoE 架构,35B 总参数 / 激活约 3B)
  • 量化方案:UD-Q4_K_XL(声称"4bit 整型分组量化")
  • 文件名:Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf
  • 文章未提供任何下载链接或 HF 仓库地址

1.2 文章宣称的性能数据

指标 文章声称值
推理速度 稳定 40 token/s
prompt 预处理速度 700 token/s
显存压缩 对比 FP16 减少 75%
FlashAttention 提升 30%(未指明版本)
KV 缓存占用 直降 6 倍
上下文窗口 131072(128K)

1.3 文章宣称的硬件门槛

部件 文章声称最低要求
显卡 RTX 3060 / 4060 8 GB 及以上 NVIDIA 显卡
内存 16 GB DDR4/DDR5 起步,优先 32 GB
硬盘 预留 60 GB 空闲空间
系统 Windows 11、Ubuntu 均可

1.4 文章给出的启动命令

llama-server -m Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf -ngl 64 --flash-attn on -c 131072 --cache-type-k q4_0 --kv-unified --threads 16

二、事实核实

2.1 模型与文件核实 ✅ 真实

核查项 结果 证据
模型 Qwen3.6-35B-A3B 真实存在 HF 上有 unsloth/Qwen3.6-35B-A3B-GGUFQwen/Qwen3.6-35B-A3B 等官方仓库
MoE 35B / 激活 ~3B 与官方一致 Unsloth README 与 Qwen 官方发布通稿均印证
UD-Q4_K_XL 量化 Unsloth Dynamic Quants 真实方案 在 HF 仓库文件名、knightli 量化表中均可见
文件 Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf 真实存在于 HF huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF/blob/main/Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf 命中
本机文件大小 22.36 GB 与 4-bit 量化预期一致 UD-IQ4_NL ~22 GB 区间
上下文长度支持 256K 与 Qwen 官方一致 默认 262144 token,可经 YaRN 扩展至 ~1M

2.2 命令参数核实 ✅ 真实(已逐项用 --help 验证)

环境:llama-server b10182 (f0c9b6dfc), built with MSVC 19.44.35217.0 for x64

参数 短选项 真实存在 取值合法性
-m 文件路径
-ngl 64 --gpu-layers / --n-gpu-layers 整数,默认 1024
--flash-attn on -fa 取值 on/off/auto,默认 auto
-c 131072 --ctx-size 整数
--cache-type-k q4_0 -ctk 取值如 f16/q4_0/q8_0
--kv-unified -kvu 开关标志
--threads 6 -t 整数,默认 -1

结论:文章里所有 6 个参数都是 llama.cpp 当前主线版本的合法选项,不存在编造。

2.3 硬件门槛核实 ❌ 严重失实

Unsloth 官方硬件需求表(来自 unsloth.ai/docs/models/qwen3.6):

量化(35B-A3B) 总内存需求(RAM + VRAM 之和,或统一内存)
3-bit 18 GB
4-bit 24 GB
6-bit 31 GB
8-bit 39 GB
BF16 71 GB

按 knightli.com 量化对照表:

量化 权重文件大小 推荐 VRAM
UD-IQ2_M ~10–11 GB 12 GB
UD-IQ3_XXS ~13 GB 16 GB
UD-Q4_K_M/XL 22.13 GB 24 GB 起
UD-Q5_K_M 26.46 GB 32 GB
UD-Q6_K 29.31 GB 48 GB

结论:文章"8G 显卡玩转"的标题与官方 24 GB 起步门槛差了一个数量级。即使 8 GB 显卡硬跑,也只能通过大量 CPU 卸载,速度不可能达到文章宣称的 40 token/s。

2.4 性能数字核实 ⚠️ 多处错误或夸大

文章说法 实际情况 评级
“对比 FP16 显存减少 75%” 22 GB / 70 GB ≈ 31%,减少约 69–75%,口径大致合理 ✅ 基本属实
“FlashAttention 3 效率提升 30%” llama.cpp 内置是 FA2,不是 FA3;FA3 仅 Hopper 架构支持(SM 9.0),RTX 30/40/50 系列用不了 ❌ 含糊误导
“KV 缓存占用直降 6 倍” q4_0 相对 FP16 是 4 倍压缩(16 / 4 = 4),不是 6 倍 ❌ 数字错误
“稳定 40 token/s @ 8G” 12 GB 显存同模型实测仅 ~20 t/s(B 站 BV1XmdJB7ENF);8 GB 物理更慢 ❌ 严重夸大
“prompt 预处理 700 token/s” 未提供对照基准,且高度依赖硬件 ⚠️ 无法验证

2.5 与官方推荐命令对比

Unsloth 官方推荐的 llama-server 启动模板(来自 unsloth.ai/docs/models/qwen3.6):

./llama.cpp/llama-server \
  --model unsloth/Qwen3.6-35B-A3B-GGUF/Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf \
  --mmproj unsloth/Qwen3.6-35B-A3B-GGUF/mmproj-F16.gguf \
  --alias "unsloth/Qwen3.6-35B-A3B" \
  --temp 0.6 --top-p 0.95 --ctx-size 16384 --top-k 20
Unsloth 官方 某网站文章 本机使用
上下文长度 --ctx-size 16384 -c 131072 -c 4096(已下调)
温度/top_p 等采样参数 --temp 0.6 --top-p 0.95 --top-k 20 未给 未给
mmproj(多模态投影) 给出 未提 未提

文章把上下文从官方的 16384 调到了 131072(128K),但又没有相应调高 VRAM 门槛,构成自相矛盾。


3、本机实测

3.1 环境

平台 Windows 11 Home China 10.0.26200
Shell Git Bash
llama-server 版本 b10182 (f0c9b6dfc), MSVC 19.44.35217.0
模型文件 Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf,22.36 GB,存放于 d:\AiTools\lmstudio\models\qwen\
模型来源 https://huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF

3.2 启动命令(复刻文章命令)

llama-server -m .\Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf -ngl 64 --flash-attn on -c 4096 --cache-type-k q4_0 --kv-unified --threads 6

(注:仅将 -c 131072 下调为 -c 4096 试启动;其余与文章完全一致;线程数 6 与文章的 16 不同但不会导致失败)

3.3 运行日志(含错误)

0.00.020.488 I cmn  common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg)
0.00.126.195 W srv  llama_server: CORS is set to allow all origins ('*') and no API key is set
0.00.146.552 I srv    load_model: loading model '.\Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf'
0.00.694.807 W common_fit_params: failed to fit params to free device memory: n_gpu_layers already set by user to 64, abort
0.14.876.138 E ggml_backend_cuda_buffer_type_alloc_buffer: allocating 20798.80 MiB on device 0: cudaMalloc failed: out of memory
0.14.876.250 E alloc_tensor_range: failed to allocate CUDA0 buffer of size 21809121792
0.15.016.291 E llama_model_load: error loading model: unable to allocate CUDA0 buffer
0.15.016.300 E llama_model_load_from_file_impl: failed to load model
0.15.016.881 E cmn  common_init_: failed to load model '.\Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf'
0.15.018.431 I srv   operator (): operator (): cleaning up before exit...
0.15.036.566 E srv  llama_server: exiting due to model loading error

3.4 错误诊断

错误行 含义
allocating 20798.80 MiB on device 0: cudaMalloc failed: out of memory GPU 显存小于 20.8 GB,权重本身就装不下
failed to allocate CUDA0 buffer of size 21809121792 需分配 20.32 GB,物理显存不够
common_fit_params: failed to fit params to free device memory: n_gpu_layers already set by user to 64, abort 自动适配已被 -ngl 64 手动指定跳过,否则会自动降层

根本原因:本机 GPU 显存不足。模型权重 20.8 GB,物理显存 < 20.8 GB。

GPU 型号推断

显存 是否可装下 20.8 GB 权重
8 GB(RTX 3050/3060/4060)
12 GB(RTX 3060 12G/4070)
16 GB(RTX 4060 Ti 16G/5080)
24 GB(RTX 3090/4090/5090) ⚠️ 临界

四、真实性最终评估

4.1 分项评分

维度 真实性 备注
模型本身 ✅ 真实 来自 Qwen 官方 2026-04 开源
量化方案 ✅ 真实 Unsloth Dynamic Quants 真实产品
文件名与 HF 仓库 ✅ 真实 unsloth/Qwen3.6-35B-A3B-GGUF 主仓可下载
命令参数 ✅ 真实 全部为 llama.cpp b10182 合法选项
“对比 FP16 减少 75%” ✅ 基本属实 口径合理
“8G 显卡玩转 35B” ❌ 严重失实 官方 4-bit 起步 24 GB
“稳定 40 token/s @ 8G” ❌ 严重夸大 12 GB 实测仅 ~20 t/s
“FlashAttention 3 提升 30%” ❌ 含糊误导 实为 FA2;FA3 不适用于消费级 GPU
“KV 缓存直降 6 倍” ❌ 数字错误 实际为 4 倍
“128K 上下文窗口” ✅ 技术上可行 但需要相应的 VRAM 预算

4.2 总体定性

文章本质是一篇典型的"自媒体拼凑稿"

  • 技术名词层(模型、量化、参数):属实,可作为操作参考;
  • 营销数字层(硬件门槛、性能、压缩比):掺杂夸大与错误,把不同档位硬件的素材混搭。

值得肯定:作为命令骨架是合格的;
不可信:所有"小显卡大模型""流畅 40 t/s"等吸睛数字,均与官方文档与第三方实测冲突。


五、解决方案与建议

5.1 立即可行(不换硬件)

-ngl 64 调小,让模型部分卸载到 CPU:

# 例:16 GB 显卡的稳妥起步
llama-server -m .\Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf -ngl 40 --flash-attn on -c 4096 --cache-type-k q4_0 --kv-unified --threads 6

各档 GPU 的建议 -ngl(35B-A3B 共 ~64 层):

显存 建议 -ngl 备注
8 GB 15–20 大量 CPU 卸载,速度慢(5–10 t/s)
12 GB 25–30 仍偏慢
16 GB 40 接近速度极限
24 GB 64(全部) 推荐配置,速度最佳

5.2 推荐(保留速度的更佳方案)

huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF/tree/main 下载更小量化的版本:

目标显存 推荐量化 文件大小 预期速度
8 GB UD-IQ2_M ~10–11 GB 5–10 t/s
12 GB UD-IQ3_XXS ~13 GB 10–15 t/s
16 GB UD-Q3_K_M ~15 GB 15–25 t/s
24 GB UD-Q4_K_M / UD-Q4_K_XL ~22 GB 30–50 t/s

5.3 长期方案

按 Unsloth 官方硬件表,4-bit 跑 35B-A3B 的及格线是 24 GB 显存

  • RTX 3090(二手约 ¥4000–5000)
  • RTX 4090(约 ¥14000)
  • RTX 5090(约 ¥19000)

六、参考资料

  1. 无限Token香麻了!12G显存本地部署开源Qwen3.6-35B(微信原文)
  2. Qwen3.6 也开源了,35B-A3B 需要什么配置?(知乎)
  3. Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf 文件页(HF)
  4. Qwen3.6-35B-A3B-GGUF 仓库主页(HF)
  5. Qwen3.6 本地运行指南(Unsloth 官方,含硬件表)
  6. Qwen3.6 本地显存对照表(knightli)
  7. llama.cpp 本地部署 B 站 12G 显存实测
  8. Run Qwen3.6-35B-A3B on 6GB VRAM (Medium)
  9. Qwen3.6 GitHub 部署示例(hanxiao)

以上报告由 CCB(https://github.com/claude-code-best/claude-code.git)+MiniMax-M3[1m]辅助生成于 2026-07-31,基于 llama.cpp b10182 / Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf(22.36 GB)实测,属个人观点,有误之处,请 方家指正。

更多推荐