快速上手tiny-qwen3-moe-w4a8:5分钟启动你的第一个量化MoE模型

【免费下载链接】tiny-qwen3-moe-w4a8 【免费下载链接】tiny-qwen3-moe-w4a8 项目地址: https://ai.gitcode.com/hf_mirrors/amd/tiny-qwen3-moe-w4a8

tiny-qwen3-moe-w4a8是一款基于AMD Quark优化的W4A8量化MoE模型,专为AMD MI300/MI350/MI355系列GPU设计,通过vLLM推理引擎实现高效部署。本文将带你快速掌握模型的环境准备、安装部署和基础使用方法,即使是AI新手也能轻松上手。

📋 模型核心特性速览

作为一款轻量级量化模型,tiny-qwen3-moe-w4a8具备以下关键特性:

  • 创新量化技术:采用W4A8量化方案(INT4权重+FP8激活),在保持性能的同时显著降低显存占用
  • MoE架构优势:包含8个专家层(num_experts=8),每次推理动态选择2个专家(num_experts_per_tok=2)
  • AMD硬件优化:专为gfx942/gfx950架构优化,通过ROCm AITER融合MoE内核实现高效计算
  • 轻量级设计:隐藏层维度2048(hidden_size=2048),仅2层Transformer结构(num_hidden_layers=2)

提示:该模型主要用于vLLM的CI测试验证,权重为随机初始化,不保证生成有意义文本。

🔧 环境准备与安装

系统要求

  • GPU支持:AMD MI300/MI350/MI355系列(gfx942/gfx950架构)
  • 软件依赖
    • Python 3.8+
    • ROCm 5.7+
    • vLLM 0.4.0+
    • PyTorch 2.0+

快速安装步骤

  1. 克隆模型仓库
git clone https://gitcode.com/hf_mirrors/amd/tiny-qwen3-moe-w4a8
cd tiny-qwen3-moe-w4a8
  1. 安装依赖包
pip install vllm transformers torch

🚀 启动模型服务

通过vLLM启动模型服务仅需一行命令,记得启用AITER加速:

VLLM_ROCM_USE_AITER=1 VLLM_ROCM_USE_AITER_MOE=1 \
  vllm serve ./ --enforce-eager

启动成功后,你将看到类似以下输出:

INFO 07-29 08:30:32 llm_engine.py:129] Initializing an LLM engine with config: ...
INFO 07-29 08:30:35 server.py:271] Started server process [12345]
INFO 07-29 08:30:35 server.py:300] Uvicorn running on http://0.0.0.0:8000 (Press CTRL+C to quit)

🔍 模型配置解析

模型配置文件config.json包含关键参数:

  • 量化配置:采用INT4每通道对称量化(Int4PerChannelSpec)和FP8每张量动态量化(FP8E4M3PerTensorSpec)
  • 架构细节:16个注意力头(num_attention_heads=16),2个键值头(num_key_value_heads=2)
  • 序列长度:最大上下文长度2048(max_position_embeddings=2048)
  • 排除量化层:注意力层、MLP门控和lm_head保持原始精度

❓ 常见问题解答

Q: 为什么模型输出没有意义?

A: 该模型是随机初始化的结构测试模型,仅用于验证W4A8量化MoE路径的正确性,不具备实际文本生成能力。

Q: 支持哪些推理框架?

A: 官方推荐使用vLLM,需启用ROCm AITER加速(设置VLLM_ROCM_USE_AITER=1)。

Q: 如何验证模型是否正确加载?

A: 启动服务后,可通过curl发送测试请求:

curl http://localhost:8000/generate \
  -H "Content-Type: application/json" \
  -d '{"prompt": "Hello world", "max_tokens": 50}'

📄 许可证信息

本项目采用Apache-2.0许可证,详情参见LICENSE文件。模型权重为随机初始化,不衍生自任何基础模型。

Modifications Copyright(c) 2026 Advanced Micro Devices, Inc. All rights reserved.

【免费下载链接】tiny-qwen3-moe-w4a8 【免费下载链接】tiny-qwen3-moe-w4a8 项目地址: https://ai.gitcode.com/hf_mirrors/amd/tiny-qwen3-moe-w4a8

更多推荐