阿里开源的 Qwen3.6-35B-A3B 凭借其独特的 MoE(混合专家)架构(35B总参数,单次前向仅激活 3B),在智能体编程(Agentic Coding)和复杂逻辑推理上直接把性能拉满了。
最让人兴奋的是,通过最新的量化与混合计算架构,这款 35B 级别 的大模型已经彻底放下了硬件身段:
平台全覆盖: 完美支持 Windows 和 macOS。
显卡不挑食:无论你是 NVIDIA(N卡)、Intel(I卡)还是 AMD(A卡),统统都能跑!
低配显存福音: 官方给出了自选配置组合,**最低只需 8G 显存** 就能流畅运行!
今天这篇教程,就带大家用最稳、最快的方式,在本地把 Qwen3.6-35B 跑起来!
一、 为什么 Qwen3.6-35B 能在 8G 显存上运行?
传统的 35B 密集模型(Dense)如果想跑 BF16 精度,起步就需要 70GB+ 的显存,哪怕是 Q4 量化也需要 20GB+,直接劝退了大部分消费级显卡用户。
但 Qwen3.6-35B-A3B 采用了 MoE(Mixture of Experts) 架构。
> 核心机制:它的总知识库有 350 亿参数,但内部由 256 个“专家”组成。当你向它提问时,它每次只会激活其中的 1 个共享专家和 8 个路由专家(共约 3B 参数)。这意味着:**你用的是 35B 的知识大脑,但消耗的却只是 3B 级别的计算量!**

配合 Llama.cpp / KTransformers** 的异构计算(CPU + GPU 混合分流),我们就可以把模型切碎,显存够就多塞进 GPU,显存不够就把剩下的塞进系统内存(RAM)。
 二、 核心硬件配置自选指南
在开始部署前,请先根据你的设备显存(VRAM)和内存(RAM),选择对应的量化版本(GGUF 格式):
| 显卡类型 | 显存容量 (VRAM) | 推荐系统内存 (RAM) | 推荐 Qwen3.6-35B 量化版本 | 运行模式 |
|---|---|---|---|---|
| 低配档 (N/A/I卡) | 8G | 32G / 64G | IQ2_M 或 Q2_K | CPU+GPU 混合卸载 (Offloading) |
| 中配档 (N/A/I卡) | 12G - 16G | 32G | Q3_K_M 或 Q4_K_M | 混合卸载 / Vulkan 模式加速 |
| 高配档 (如RTX 4090) | 24G | 32G | Q4_K_L / Q5_K_M | 显存全流出(纯 GPU 加速) |
| Mac 系列(M1/M2/M3) | **统一内存 24G+** | (共享) | **Q4_K_M** | Apple Silicon(Metal 加速) |
 三、 保姆级部署步骤(多端通用)
目前最推荐、也是对**多卡种(N/I/A)以及*Mac 支持最完美的部署工具是 Unsloth Studio 或Llama.cp*。这里我们使用跨平台兼容性最好的集成方案。
 步骤 1:安装基础运行环境
 1. Windows 用户
如果使用 NVIDIA 显卡,请确保安装了 **CUDA Toolkit**(推荐 12.1 及以上)。
如果是 AMD 或 Intel 显卡,我们将通过 **Vulkan 后端** 运行,无需额外配置复杂的私有驱动。
 2. macOS 用户
无需额外驱动,系统自带的 Metal 架构开箱即用。
步骤 2:使用极简工具一键拉起(以支持 MTP 加速的方案为例)
为了让 Qwen3.6 跑出 1.4x ~ 2.2x 的极限速度,我们推荐使用已经原生合并了 MTP(多 Token 预测)支持的客户端,或者经典的 llama.cpp。
打开你的终端(Windows 用 PowerShell,Mac 用 Terminal),执行以下步骤:
 1. 快速初始化
```bash
# 确保安装了 Python 环境,拉取最新的轻量级管理端(以开源的工具为例)
pip install unsloth

```
#### 2. 启动本地 Web UI 服务
在终端中输入以下命令启动本地推理服务:
```bash
unsloth studio -H 127.0.0.1 -p 8888

```
随后在浏览器中打开 http://127.0.0.1:8888,你将看到一个极简的配置界面。
 步骤 3:模型选择与配置(核心改动!)
在 UI 界面或者配置文件中,搜索 Qwen3.6-35B-A3B-GGUF。
根据你的显存大小,修改核心运行参数:
对于 8G 显存用户(关键):
   将 n_gpu_layers(GPU 卸载层数)设置为 15 到 20 之间。这样它会把 40 层模型中的一部分放进显存加速,剩下的留给 CPU,防止显存溢出(OOM)。
对于 AMD / Intel 显卡用户:
   在后端类型(Backend)中显式勾选 **Vulkan**。实测在 16G 显存的 A卡/I卡上,Vulkan 后端的图像和文本吞吐甚至比某些传统兼容层还要稳定!
开启思维保留(Thinking Preservation):
   Qwen3.6 支持自适应思考模式。在高级参数(Chat Template Kwargs)中,添加:
   ```json
   { "preserve_thinking": true }
   
   ```
   这样可以完整保留历史对话中的推理上下文,非常适合做复杂的长代码迭代开发!
四、 本地实测体验:35B 的大局观名不虚传
部署完成后,我第一时间用 **8G 显存 + 32G 内存** 的普通 Windows 笔记本进行了实测:
 提问:
> “请帮我写一个基于 Python 的分布式异步爬虫,要求自适应控制并发,并防止内存泄露。”

💡 模型输出片段:
```python
import asyncio
from aiohttp import ClientSession, ClientTimeout

class AdaptiveScraper:
    def __init__(self, urls, max_concurrency=10):
        self.urls = urls
        self.semaphore = asyncio.Semaphore(max_concurrency) # Qwen3.6精准控制了并发
        self.timeout = ClientTimeout(total=15)

    async def fetch(self, session, url):
        async with self.semaphore:
            # 自动生成的指数退避重试逻辑
            for attempt in range(3):
                try:
                    async with session.get(url, timeout=self.timeout) as response:
                        return await response.json()
                except asyncio.TimeoutError:
                    await asyncio.sleep(2 ** attempt)

```
> 实测反馈:
> 虽然在 8G 显存下由于走了一部分 CPU 内存,生成速度大概在 5~8 tokens/s*左右(Mac 或 24G 纯显存下可飚到 15~240 tokens/s),但它的**逻辑完整度和代码质量完全是顶尖 35B 模型的水准**!没有出现任何小模型常见的逻辑混乱。

五、 部署常见坑点与解决办法
 1. 报错 Out of Memory (OOM) 怎么办?
   解决: 说明你的 n_gpu_layers 设高了。请尝试每次调小 2~3 层,直到能顺利跑完 Prefill(预填)阶段。
 2.生成的代码老是自我重复?**
   解决: Qwen3.6 官方建议将 presence_penalty(存在惩罚)设置在 0.0 到 2.0 之间。如果遇到重复,可以微调该参数至 0.5。

更多推荐