Radeon Cloud 快速部署 Gemma 4 模型运行学习笔记

1. 环境准备与确认

首先前往 AMD Radeon Cloud 平台。

创建笔记或直接点击启动 Hello ROCm Bate笔记。在这里插入图片描述

在开始部署前,首先确认 GPU 环境是否就绪。

  • 确认 GPU 可用性: 使用 amd-smi 指令检查 GPU 状态。
  • 验证 PyTorch 环境: 运行以下命令确认 PyTorch 能正确识别 AMD GPU:
python -c "import torch; print('PyTorch:', torch.__version__); print('ROCm available:', torch.cuda.is_available()); print('Device:', torch.cuda.get_device_name(0) if torch.cuda.is_available() else 'N/A')"

2. 模型下载

为了获得更稳定的下载速度,通过魔搭 ModelScope 社区进行模型获取。

  1. 配置镜像源: 切换至腾讯云镜像源以加速依赖下载。
pip config set global.index-url https://mirrors.cloud.tencent.com/pypi/simple/

  1. 安装 ModelScope:
pip install modelscope

  1. 下载模型: 使用以下命令将 Gemma 4 模型下载至指定目录:
modelscope download --model google/gemma-4-E4B-it --cache_dir "./models"

💡 注意: 耐心等待直到看到“Successfully Downloaded”提示。

  1. 验证完整性: 检查权重文件是否下载成功。
ls -lh ./models/google/gemma-4-E4B-it/

3. 启动 vLLM 推理服务

vLLM 是高效的推理框架,在启动前需确保环境配置正确。

  1. 环境准备: 卸载冲突包并安装 vLLM 及相关依赖。
uv pip uninstall torchvision
uv pip install vllm torchvision --no-cache --index-url https://mirrors.aliyun.com/pypi/simple/ --extra-index-url https://wheels.vllm.ai/rocm/ -U

  1. 启动服务:
vllm serve ./models/google/gemma-4-E4B-it/ --served-model-name gemma-4-E4B-it

⚠️ 警告: 服务启动后,该终端窗口将被占用,请保持其运行,不要关闭或中断。

4. 对话测试

打开一个新的终端窗口进行交互测试。

  1. 运行对话测试命令:
vllm chat --url http://localhost:8000/v1 --model gemma-4-E4B-it

  1. 测试互动: 输入“你是谁,你能做什么”来验证模型响应。

5. 任务总结与资源释放

完成后,需要及时关闭服务并销毁实例,避免资源浪费。

  • 停止服务: 在各终端窗口按 Ctrl+C 退出聊天及结束 vLLM 服务。
  • 清理资源: 确保已保存必要产出后,前往云平台个人主页(Profile),点击 Destroy Instance

#Datawhale #AMDev

Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐