Qwen3.6-35B-A3B-w8a8-llmcompressor-v0.12.0深度解析:AMD ZenDNN优化的CPU推理革命

【免费下载链接】Qwen3.6-35B-A3B-w8a8-llmcompressor-v0.12.0 【免费下载链接】Qwen3.6-35B-A3B-w8a8-llmcompressor-v0.12.0 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen3.6-35B-A3B-w8a8-llmcompressor-v0.12.0

Qwen3.6-35B-A3B-w8a8-llmcompressor-v0.12.0是由AMD基于LLM Compressor技术优化的量化模型,专为AMD EPYC CPU打造,通过ZenDNN加速实现高效文本生成。该模型将原始67.0 GiB的Qwen3.6-35B-A3B模型压缩至35.1 GiB,在保持性能的同时实现48%的存储节省,为企业级CPU推理场景带来革命性突破。

核心技术解析:W8A8量化与ZenDNN加速

什么是W8A8量化?

该模型采用创新的8位权重(W8)和8位动态激活(A8)量化方案,通过Round-to-Nearest(RTN)算法实现精准压缩。量化过程中,模型权重被转换为INT8格式并采用对称、按通道(per-channel)静态量化策略,而激活值则采用按令牌(per-token)动态量化,确保关键计算节点(如MoE路由器、视觉塔和线性注意力模块)保持BF16精度。

量化配置在config.json中明确定义,核心参数包括:

  • 权重:INT8,对称,per-channel静态量化
  • 激活:INT8,对称,per-token动态量化
  • 忽略量化层:lm_head、mlp.gate、visual模块等关键组件

ZenDNN优化如何提升CPU性能?

作为AMD Zen架构的深度学习加速引擎,ZenDNN v6.1.0通过以下方式优化推理性能:

  • 针对EPYC处理器的AVX-512指令集深度优化
  • 与ZenTorch v2.11.0.3和PyTorch v2.11.0无缝集成
  • 高效内存管理减少数据搬运开销
  • 多线程并行计算充分利用CPU核心资源

快速上手指南:从安装到推理

环境准备与安装步骤

  1. 克隆仓库

    git clone https://gitcode.com/hf_mirrors/amd/Qwen3.6-35B-A3B-w8a8-llmcompressor-v0.12.0
    cd Qwen3.6-35B-A3B-w8a8-llmcompressor-v0.12.0
    
  2. 安装依赖

    pip install torch==2.11.0 zentorch==2.11.0.3 vllm==0.26.0 llmcompressor==0.12.0
    
  3. 配置OpenMP环境 为充分发挥多线程性能,需设置LD_PRELOAD环境变量:

    # 使用LLVM OpenMP
    export LD_PRELOAD=$(find /path/to/env -name "libomp.so" | head -1)
    
    # 或使用Intel OpenMP
    export LD_PRELOAD=$(find /path/to/env -name "libiomp5.so" | head -1)
    

使用vLLM进行高效推理

通过vLLM引擎实现低延迟文本生成:

from vllm import LLM, SamplingParams

# 加载模型
model = LLM(
    model="amd/Qwen3.6-35B-A3B-w8a8-llmcompressor-v0.12.0",
    dtype="bfloat16",
)

# 配置生成参数
sampling_params = SamplingParams(temperature=0.7, max_tokens=256)

# 生成文本
outputs = model.generate(["Hello, how are you?"], sampling_params)
print(outputs[0].outputs[0].text)

性能评估:精度与效率的平衡

基准测试结果

在GSM8K(5-shot)基准测试中,该量化模型实现了与BF16原始模型100%的精度恢复率:

基准测试 BF16基准 W8A8量化模型 精度恢复率
GSM8K (5-shot) 0.9629 0.9629 100%

更多基准测试结果将在完整评估后更新

运行评估命令

使用lm-evaluation-harness进行模型评估:

lm_eval \
    --model vllm \
    --model_args pretrained=amd/Qwen3.6-35B-A3B-w8a8-llmcompressor-v0.12.0,tokenizer=Qwen/Qwen3.6-35B-A3B,dtype=bfloat16,max_model_len=4096,language_model_only=True,enable_thinking=False \
    --tasks gsm8k \
    --batch_size auto \
    --trust_remote_code \
    --num_fewshot 5 \
    --apply_chat_template \
    --log_samples \
    --gen_kwargs "max_gen_toks=2048" \
    --output_path .

模型局限性与最佳实践

已知限制

  • 版本锁定:需严格匹配ZenDNN v6.1.0 / ZenTorch v2.11.0.3 / PyTorch v2.11.0版本组合
  • CPU专用:优化仅针对AMD EPYC CPU,不支持GPU推理
  • 依赖要求:需OpenMP支持以获得最佳多线程性能

最佳实践建议

  1. 硬件选择:推荐使用AMD EPYC 7003/7004系列处理器,至少64GB内存
  2. 系统优化:启用CPU性能模式,关闭超线程以减少延迟
  3. 批量处理:调整vLLM的batch_size参数平衡吞吐量与延迟
  4. 监控工具:使用ZenMonitor跟踪CPU利用率和内存带宽

许可证与法律信息

本模型基于与原始模型相同的Apache-2.0许可证分发,详细信息参见LICENSE文件。修改部分版权所有(c) 2026 Advanced Micro Devices, Inc.

技术支持与资源

  • 官方文档:参考README.md获取完整技术细节
  • 量化配置recipe.yaml包含量化策略定义
  • 推理代码:模型加载与生成示例在README.md中提供
  • 社区支持:通过AMD开发者论坛获取技术支持

【免费下载链接】Qwen3.6-35B-A3B-w8a8-llmcompressor-v0.12.0 【免费下载链接】Qwen3.6-35B-A3B-w8a8-llmcompressor-v0.12.0 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen3.6-35B-A3B-w8a8-llmcompressor-v0.12.0

更多推荐