前置准备

  • 注册登录“AMD开发者云”,参考文档:https://ailc.datawhale.cn/hall/group/100000144/task/100000035, 我是通过“ModelScope魔搭社区”账号登录。

  • 去https://developer.amd.com.cn/完成“AMD开发者云”的资料认证,领取免费算力支持。

【注】提前领取积分兑换免费算力券,后续环境需要使用到算力支持。

前置环境

1、进入【AMD开发者云】:https://radeon.anruicloud.com/, 找到:【Hello ROCm Base】 课程,点击【Launch】启动

2、启动后,点击【Open Notebook】跳转到【魔搭社区】打开云上运行环境。会看到同步到云上运行环境的文件

在这里插入图片描述

部署运行Gemma4

检查GPU&Pytorch

  • 打开Terminal终端
# 检查当前GPU是否可用
amd-smi

# 确认Pytorch能识别AMD GPU

python -c "import torch; print('PyTorch:', torch.__version__); print('ROCm available:', torch.cuda.is_available()); print('Device:', torch.cuda.get_device_name(0) if torch.cuda.is_available() else 'N/A')"

在这里插入图片描述

下载Gemma4模型

切换镜像源,提高下载速度

pip config set global.index-url https://mirrors.cloud.tencent.com/pypi/simple/

安装ModelScope

pip install modelscope

下载模型到models目录, 下载耗时大约8分钟

modelscope download --model google/gemma-4-E4B-it --cache_dir "./models"

查看模型文件,大约15GB,model.safetensors是模型权重

ls -lh ./models/google/gemma-4-E4B-it/

在这里插入图片描述

启动Gemma4

安装相关依赖

# 经测试,在该云环境中,需卸载重新安装这个库才能正常使用
uv pip uninstall torchvision torchaudio

# 安装指定vllm版本及相关依赖
uv pip install 'vllm==0.23.0+rocm723' torchvision torchaudio 'fastapi[standard]==0.136.0' \
  --no-cache \
  --index-url https://mirrors.aliyun.com/pypi/simple/ \
  --extra-index-url https://wheels.vllm.ai/rocm/ \
  -U

启动vllm服务

# 存储空间重组使用
vllm serve ./models/google/gemma-4-E4B-it/ --served-model-name gemma-4-E4B-it


# 存储不足使用
vllm serve ./models/google/gemma-4-E4B-it/ --served-model-name gemma-4-E4B-it --max-model-len 8192

【注】运行这个命令后,这个终端窗口就会 被大模型服务“死死占满” 。请 保持运行,绝对不要关闭它 ,也不要按 Ctrl+C ,否则大模型服务就会立刻停止。

在这里插入图片描述

测试验证

新开终端启动,输入对话即可

vllm chat --url http://localhost:8000/v1 --model gemma-4-E4B-it

销毁实例

不使用服务时,及时销毁实例,避免算力消耗。
销毁实例

参考

【AMD Hello-ROCm学习活动】https://ailc.datawhale.cn/hall/group/100000144/task/100000036

Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐