快速上手tiny-qwen3-moe-w4a8:5分钟启动你的第一个量化MoE模型
快速上手tiny-qwen3-moe-w4a8:5分钟启动你的第一个量化MoE模型
【免费下载链接】tiny-qwen3-moe-w4a8 项目地址: https://ai.gitcode.com/hf_mirrors/amd/tiny-qwen3-moe-w4a8
tiny-qwen3-moe-w4a8是一款基于AMD Quark优化的W4A8量化MoE模型,专为AMD MI300/MI350/MI355系列GPU设计,通过vLLM推理引擎实现高效部署。本文将带你快速掌握模型的环境准备、安装部署和基础使用方法,即使是AI新手也能轻松上手。
📋 模型核心特性速览
作为一款轻量级量化模型,tiny-qwen3-moe-w4a8具备以下关键特性:
- 创新量化技术:采用W4A8量化方案(INT4权重+FP8激活),在保持性能的同时显著降低显存占用
- MoE架构优势:包含8个专家层(num_experts=8),每次推理动态选择2个专家(num_experts_per_tok=2)
- AMD硬件优化:专为gfx942/gfx950架构优化,通过ROCm AITER融合MoE内核实现高效计算
- 轻量级设计:隐藏层维度2048(hidden_size=2048),仅2层Transformer结构(num_hidden_layers=2)
提示:该模型主要用于vLLM的CI测试验证,权重为随机初始化,不保证生成有意义文本。
🔧 环境准备与安装
系统要求
- GPU支持:AMD MI300/MI350/MI355系列(gfx942/gfx950架构)
- 软件依赖:
- Python 3.8+
- ROCm 5.7+
- vLLM 0.4.0+
- PyTorch 2.0+
快速安装步骤
- 克隆模型仓库
git clone https://gitcode.com/hf_mirrors/amd/tiny-qwen3-moe-w4a8
cd tiny-qwen3-moe-w4a8
- 安装依赖包
pip install vllm transformers torch
🚀 启动模型服务
通过vLLM启动模型服务仅需一行命令,记得启用AITER加速:
VLLM_ROCM_USE_AITER=1 VLLM_ROCM_USE_AITER_MOE=1 \
vllm serve ./ --enforce-eager
启动成功后,你将看到类似以下输出:
INFO 07-29 08:30:32 llm_engine.py:129] Initializing an LLM engine with config: ...
INFO 07-29 08:30:35 server.py:271] Started server process [12345]
INFO 07-29 08:30:35 server.py:300] Uvicorn running on http://0.0.0.0:8000 (Press CTRL+C to quit)
🔍 模型配置解析
模型配置文件config.json包含关键参数:
- 量化配置:采用INT4每通道对称量化(Int4PerChannelSpec)和FP8每张量动态量化(FP8E4M3PerTensorSpec)
- 架构细节:16个注意力头(num_attention_heads=16),2个键值头(num_key_value_heads=2)
- 序列长度:最大上下文长度2048(max_position_embeddings=2048)
- 排除量化层:注意力层、MLP门控和lm_head保持原始精度
❓ 常见问题解答
Q: 为什么模型输出没有意义?
A: 该模型是随机初始化的结构测试模型,仅用于验证W4A8量化MoE路径的正确性,不具备实际文本生成能力。
Q: 支持哪些推理框架?
A: 官方推荐使用vLLM,需启用ROCm AITER加速(设置VLLM_ROCM_USE_AITER=1)。
Q: 如何验证模型是否正确加载?
A: 启动服务后,可通过curl发送测试请求:
curl http://localhost:8000/generate \
-H "Content-Type: application/json" \
-d '{"prompt": "Hello world", "max_tokens": 50}'
📄 许可证信息
本项目采用Apache-2.0许可证,详情参见LICENSE文件。模型权重为随机初始化,不衍生自任何基础模型。
Modifications Copyright(c) 2026 Advanced Micro Devices, Inc. All rights reserved.
【免费下载链接】tiny-qwen3-moe-w4a8 项目地址: https://ai.gitcode.com/hf_mirrors/amd/tiny-qwen3-moe-w4a8
更多推荐


所有评论(0)