Qwen3.5 系列发布三个月后,团队没有急着发新论文,而是沉下来做了一件事:听开发者到底在抱怨什么。结果很清晰——大家不要更聪明的"考试机器",要的是稳定、直观、响应快的编码助手。Qwen3.6 就是冲着这个痛点来的。

这次升级最直观的感受是前端代码生成和仓库级推理的流畅度。以前让模型处理一个完整的 React 项目,它经常在中途"失忆"或者把组件关系搞混。Qwen3.6 在这块明显稳了很多,上下文保持得更完整,逻辑链条不容易断。

还有一个容易被忽略但极实用的设计:思维保留(Preserve Thinking)。默认情况下,模型只保留处理最新用户消息时的推理轨迹,形成所谓的"交错思维"模式。但 Qwen3.6 额外训练了历史消息中思维轨迹的复用能力。开启这个选项后,Agent 场景下的决策一致性会大幅提升,而且很多时候能减少重复推理带来的 token 消耗,KV 缓存的利用率也跟着上去了。


架构层面到底改了什么

Qwen3.6-27B 是一款基于视觉编码器的因果语言模型,总参数量 270 亿,隐藏维度 5120,堆了 64 层。它的层内布局很有意思,不是简单的"注意力 + FFN"重复,而是采用了 16 × (3 × (门控 DeltaNet → FFN) → 1 × (门控注意力 → FFN)) 的混合结构

具体来说,门控 DeltaNet 部分配置了 48 个线性注意力头(V 方向)和 16 个 QK 头,头维度 128;门控注意力部分则是 24 个 Q 头和 4 个 KV 头,头维度拉到 256。旋转位置编码(RoPE)维度 64,FFN 中间层尺寸 17408。这种设计让它在保持计算效率的同时,对长距离依赖的捕捉能力更强。

原生上下文长度已经给到了 262,144 token,通过 YaRN 技术还能扩展到 1,010,000 token。这意味着你可以直接扔进去一部长篇小说或者一个中型代码库,让它做整体分析

Understanding and Implementing Qwen3 From Scratch


跑分不是全部,但跑分很说明问题

先上一组硬核数据。在代码能力这块,Qwen3.6-27B 的 SWE-bench Verified 拿到了 77.2,SWE-bench Pro 53.5,Terminal-Bench 2.0 直接干到了 59.3——这个分数已经跟 Claude 4.5 作品持平。SkillsBench 均值更是冲到了 48.2,比 Qwen3.5-397B-A17B 这种超大 MoE 模型还高出一截。

知识类基准同样扎实:MMLU-Pro 86.2,SuperGPQA 66.0,C-Eval 91.4。STEM 推理方面,GPQA Diamond 87.8AIME 2026 94.1,HMMT 2026 年 2 月卷 84.3。视觉理解也没落下,MMMU 82.9,VideoMME(带字幕)87.7

Best Local AI Coder for Mac: Qwen3.6 vs Gemma 4 (2026)

这些数字背后有个值得注意的趋势:Qwen3.6 用 27B 的 Dense 体量,在不少编码任务上逼平甚至超过了参数大十几倍的 MoE 模型。这说明架构效率和训练质量的重要性,正在逐渐超过单纯的参数竞赛。


NVFP4 量化:24GB 显存的救赎

如果你手里只有一张 24GB 显存的卡,以前跑 27B 模型基本只能望洋兴叹。但 Unsloth 团队给 Qwen3.6 做了一套 NVFP4 量化方案,基于 Unsloth 数据集和 UltraChat 的混合数据校准,速度比官方 NVFP4 量化器快 2.5 倍

精度方面不用担心。MMLU-Pro、GPQA、AIME 2025 三项测试里,Unsloth NVFP4 版本跟 FP8、BF16 的差距都在小数点后两位,实际使用几乎感知不到

Introducing NVFP4 for Efficient and Accurate Low-Precision Inference |  NVIDIA Technical Blog

Qwen on Mac (2026): Best 3.6 & 3.5 Models by RAM Tier

部署时记得避开 Marlin 后端,它的速度会慢整整两倍。正确姿势是用原生 vLLM 或者 cute-DSL / CUTLASS / flashinfer_trtllm 后端。在 B200 上实测,Unsloth 27B 的吞吐量可以达到 6,863 tok/s,而 NVIDIA 官方版本只有 2,403 tok/s。如果你用的是 DGX Spark,务必加上 export CUTE_DSL_ARCH=sm_121a,否则性能直接腰斩。

另外这个检查点内置了 MTP(多标记预测) 模块,可以把它自己当作推测性草稿来用,解码速度会更快启动命令很简单:

bash

vllm serve unsloth/Qwen3.6-27B-NVFP4 \
    --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'

手把手部署:从 vLLM 到 SGLang

Qwen3.6 的兼容性做得相当好,Hugging Face Transformers、vLLM、SGLang、KTransformers 这些主流框架都能跑。

vLLM 方案(推荐用于 NVFP4 量化版)

先建个独立环境:

bash

uv venv unsloth-nvfp4-env --python 3.13
source unsloth-nvfp4-env/bin/activate
uv pip install "vllm>=0.25.0" "flashinfer-python>=0.6.13" \
    "nvidia-cutlass-dsl>=4.5.2" --torch-backend=auto

然后启动服务:

bash

vllm serve unsloth/Qwen3.6-27B-NVFP4 \
    --trust-remote-code --dtype bfloat16 --max-model-len 4096

默认上下文长度是 262k,如果遇到 OOM可以逐步下调 max-model-len,但建议至少保留 128k,否则模型处理复杂任务的能力会明显受限。

Architecture Overview - vLLM

SGLang 方案

SGLang 对 Qwen3.6 的支持也很成熟,推荐 sglang>=0.5.10。标准启动命令:

bash

python -m sglang.launch_server --model-path Qwen/Qwen3.6-27B \
    --port 8000 --tp-size 8 --mem-fraction-static 0.8 \
    --context-length 262144 --reasoning-parser qwen3

如果需要工具调用,加上 --tool-call-parser qwen3_coder;想开 MTP,再加 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4

Transformers 轻量方案

只想快速验证的话,用 Transformers 自带的服务器最省事:

bash

pip install "transformers[serving]"
transformers serve Qwen/Qwen3.6-27B --port 8000 --continuous-batching

它会自动把模型放到可用的加速器上,API 端点同样开在 http://localhost:8000/v1


API 调用实战:文本、图像、视频全搞定

Qwen3.6 提供了 OpenAI 兼容的 Chat Completions API,接入成本几乎为零。

纯文本对话

Python

from openai import OpenAI
client = OpenAI()

messages = [{"role": "user", "content": "Type 'I love Qwen3.6' backwards"}]

response = client.chat.completions.create(
    model="Qwen/Qwen3.6-27B",
    messages=messages,
    max_tokens=81920,
    temperature=1.0,
    top_p=0.95,
    extra_body={"top_k": 20},
)

图像理解

Python

messages = [{
    "role": "user",
    "content": [
        {"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}},
        {"type": "text", "text": "描述这张图里的内容"}
    ]
}]

视频分析

视频输入支持自定义采样帧率,默认 fps=2。如果 vLLM 启动时加了 --media-io-kwargs '{"video": {"num_frames": -1}}',可以通过 extra_body 调整:

Python

extra_body={
    "top_k": 20,
    "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True},
}

Top 5 AI Coding Assistants You Must Try - KDnuggets

思考模式 vs 指令模式

Qwen3.6 默认先思考再回答。如果你需要直接响应,不想看推理过程,可以在 extra_body 里加:

Python

"chat_template_kwargs": {"enable_thinking": False}

阿里云模型工作室的 API 用户,直接用 "enable_thinking": False 即可。

保留思维轨迹

Agent 开发强烈建议开启 preserve_thinking配置方式:

Python

"chat_template_kwargs": {"preserve_thinking": True}

这个设置对多轮对话和工具调用场景的收益非常大,模型能记住之前的推理路径,避免重复劳动。


超长文本的终极解法:YaRN

262k 的上下文对绝大多数任务已经够用了,但如果你有分析整本技术手册或者处理小时级视频的需求,可以通过 YaRN 把窗口扩展到 101 万 token

修改 config.json 里的 rope_parameters

JSON

{
    "mrope_interleaved": true,
    "mrope_section": [11, 11, 10],
    "rope_type": "yarn",
    "rope_theta": 10000000,
    "partial_rotary_factor": 0.25,
    "factor": 4.0,
    "original_max_position_embeddings": 262144
}

vLLM 用户可以通过命令行直接覆盖:

bash

VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ... \
    --hf-overrides '{"text_config": {"rope_parameters": {...}}}' \
    --max-model-len 1010000

YaRN: Efficient Context Window Extension of Large Language Models

这里有个细节要注意:静态 YaRN 的缩放因子是固定的,处理短文本时可能会轻微影响性能。建议只在确实需要长上下文时才启用,而且 factor 值要根据实际输入长度调整。比如典型上下文在 524k 左右,factor 设成 2.0 就够了


工具调用与 Agent 开发

Qwen3.6 的工具调用能力相当成熟。 quickest 的接入方式是用 Qwen-Agent,它支持 MCP 配置文件,也能集成自定义工具。

Python

from qwen_agent.agents import Assistant

llm_cfg = {
    'model': 'qwen3.6-27b',
    'model_type': 'qwenvl_oai',
    'model_server': 'https://dashscope.aliyuncs.com/compatible-mode/v1',
    'api_key': os.getenv('DASHSCOPE_API_KEY'),
    'generate_cfg': {
        'use_raw_api': True,
        'extra_body': {
            'enable_thinking': True,
            'preserve_thinking': True,
        },
    },
}

tools = [{'mcpServers': {
    "filesystem": {
        "command": "npx",
        "args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/xxxx/Desktop"]
    }
}}]

bot = Assistant(llm=llm_cfg, function_list=tools)

如果你更喜欢在终端里干活,Qwen Code 是个不错的选择。这个开源终端 AI Agent 针对 Qwen 模型做了专门优化,理解大型代码库和自动化繁琐任务的能力很强。

Lee's RoPE Tricks / Context Extension Reads - a leegao19 Collection


采样参数怎么调最合理

不同任务类型对采样参数的要求差异很大,直接抄默认配置未必是最优解。

通用任务(思考模式)

plain

temperature=1.0, top_p=0.95, top_k=20
min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

精确编码任务(思考模式)

plain

temperature=0.6, top_p=0.95, top_k=20
min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

温度降到 0.6 能让代码输出更稳定减少"灵机一动"导致的语法错误。

指令模式(非思考)

plain

temperature=0.7, top_p=0.80, top_k=20
min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0

presence_penalty 调到 1.5 可以有效抑制重复输出,但个别框架下可能会引入轻微的语言混杂,需要根据实际情况微调。

输出长度方面,日常查询建议 max_tokens=32768;数学竞赛或复杂编程题这种需要长篇推导的场景,建议直接拉到 81920


写在最后

Qwen3.6-27B 的出现,某种程度上标志着开源模型进入了一个新阶段——不再盲目追求参数规模而是把力气花在架构效率、训练质量和开发者体验上。24GB 显存就能跑起来的旗舰级代码模型,加上完整的视觉理解和百万级上下文支持,对于独立开发者和中小团队来说,门槛已经低到可以日常当主力工具用了。

如果你之前因为硬件限制或者部署复杂度而对大模型望而却步,现在或许是重新评估的时机。毕竟,能用起来的技术,才是真正有价值的技术。

Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐