白嫖192G显存GPU!ModelScope免费算力三种环境一篇讲清

作者: 杨显钊
版本: 1.0
日期: 2026年8月19日
标签: ModelScope、PAI-DSW、免费GPU、深度学习、ROCm
适合人群: 本地没有GPU、想零成本跑模型训练/推理实验的学生党和开发者


摘要

本地没有 GPU、又舍不得花钱租云主机,难道就不能跑深度学习实验了?本文带你认识 ModelScope(魔搭)免费算力:它的 Notebook 页面基于 PAI-DSW,提供 CPU、NVIDIA GPU、AMD GPU 三种环境,其中 AMD 环境给到了 192G 显存 + 100 小时免费额度。本文把三种环境的配置、预装镜像、免费额度整理成对比表,逐条拆解镜像命名含义,并给出一张选型流程图,帮你按需求对号入座、开箱即用。


一、前言

想跑个大模型玩玩,先看看自己的钱包:

  • 本地机器:笔记本核显或老显卡,显存 8G 起步都费劲,稍大的模型直接 OOM
  • 云主机:带 GPU 的实例按小时计费,跑一晚实验几十上百块没了,学生党肉疼

而 ModelScope 的 Notebook 把这条路变成了免费:注册登录就能领免费算力,浏览器里打开就能写代码、跑模型,不用装驱动、不用配环境。

我打开「我的 Notebook」页面时,看到平台已经提供了三种环境可选,其中新上的 AMD GPU 环境直接给到 192G 显存,相当大方。这篇文章就把这三种环境掰开揉碎讲清楚。


二、ModelScope Notebook 是什么?

页面上方有一句话介绍:

PAI-DSW 是为算法开发者量身打造的云端深度学习开发环境,内置 JupyterLab、WebIDE 及 Terminal,无需任何运维配置即可编写、调试及运行 Python 代码。

翻译一下,两个关键信息:

  1. 底子是 PAI-DSW:阿里云的交互式建模产品,稳定性不用操心
  2. 三种开发方式内置
    • JupyterLab:边写边跑,适合实验和演示
    • WebIDE:完整 IDE 体验,适合写工程代码
    • Terminal:终端随便敲命令,pip 装包、git 拉代码都行

也就是说,点「启动」之后你拿到的是一台装好深度学习环境的云主机,驱动、CUDA/ROCm、PyTorch 全部预装,省去新手最头疼的环境配置环节。


三、三种环境方案一览

先看页面实拍(作者账号实拍,额度为撰文时剩余值):

三种方案的关键参数整理成表:

项目 方式一 CPU环境 方式二 GPU环境 方式三 AMD GPU环境
CPU / 内存 8核 / 32GB 8核 / 32GB 8核 / 200GB
显存 24G 192G
免费额度 长期使用 限时额度(作者账号剩余 35小时36分钟) 限时额度(作者账号 100小时)
预装 ModelScope Library ModelScope Library ModelScope Library
预装镜像 ubuntu22.04-py312-torch2.3.1-1.39.0 ubuntu22.04-cuda12.8.1-py312-torch2.10.0-1.39.0 ubuntu22.04-rocm7.2.3-py312-torch2.11.0-1.39.0
软件栈 纯 CPU CUDA + PyTorch ROCm + PyTorch

说明:GPU 额度是作者账号页面撰文时的剩余显示,你的账号实际额度以官方页面实时显示为准。

三个细节值得注意:

  • CPU 环境标着「长期使用」:不消耗 GPU 额度的活(数据处理、写代码、跑小实验)丢给它,把宝贵的 GPU 小时留给真正的训练

  • NVIDIA 环境是 24G 显存:跑 7B 级别模型量化推理、中小模型微调够用;页面也提示「更高阶卡型需求,可使用个人云账号授权实例」

  • AMD 环境是 NEW 标签的新选项:192G 显存 + 200GB 内存,大显存需求直接白嫖。使用魔搭账号登录ADM AI开发者官网https://developer.amd.com.cn/点击 “积分免费兑换,畅享AMD Radeon Cloud算力券”

  • 在这里插入图片描述

  • 这个页面有详细的兑换教程,按照AMD的教程兑换好了以后 需要等待一段时间,即可在魔搭上面看到我们得到的算力服务器

AMD开发者网站 可通过完成任务获取积分,积分用于换算力时间。


四、实探 AMD 环境:192G 显存到底是什么卡?

光看页面参数还不够,启动方式三的 AMD 环境,用 amd-smirocminfo 两条命令验明正身。先看 amd-smi 的关键输出(已裁剪无关行):

# amd-smi
+------------------------------------------------------------------------------+
| AMD-SMI 26.2.2+c2d9476115    amdgpu version: 6.10.5   ROCm version: 7.2.3    |
|-------------------------------------+----------------------------------------|
| BDF                        GPU-Name | Mem-Uti   Temp   UEC       Power-Usage |
|=====================================+========================================|
| 0000:00:01.0                 0x74b6 | 0 %      48 °C   0           166/650 W |
|   0       0       3             N/A | 1 %        N/A           285/196288 MB |
+-------------------------------------+----------------------------------------+

翻译成文字说明,几个关键点:

  • 架构实锤rocminfo 里 GPU agent 的 ISA 名为 gfx942,即 AMD CDNA 3 架构,对应 Instinct MI300 系列数据中心计算卡——上一章凭 192G 显存做的推测,这里得到确认
  • 显存amd-smi 显示总量 196288 MB(≈192GB),与页面「显存192G」一致;rocminfo 还显示带 256MB L3 缓存
  • 算力规格:80 个计算单元(CU)、16 个 Shader Engines、最高频率 1850MHz,Wavefront 64,支持 Fast F16 半精度加速
  • 功耗温度:功耗上限 650W,空闲时约 166W、48°C,余量充足
  • 软件栈:ROCm 7.2.3 + amdgpu 驱动 6.10.5,和预装镜像名里的 rocm7.2.3 字段完全对应
  • 提供形式amd-smi 显示 Platform: Linux Guest,实例以云端虚拟机形式提供

一个有意思的细节:完整版 MI300X 是 304 个 CU,这里拿到 80 个——算力是切片分配的,显存却给足了完整 192G。对装载大模型来说,显存往往比算力更稀缺,这种分配方式算是把好钢用在了刀刃上。


五、预装镜像命名怎么读?

镜像名看着长,其实是固定格式,拆开就懂:

ubuntu22.04-cuda12.8.1-py312-torch2.10.0-1.39.0
└─ 系统 ─┘└── 加速栈 ──┘└ Python ┘└─ PyTorch ─┘└ ModelScope Library 版本 ┘
字段 含义 三个环境的取值
ubuntu22.04 操作系统版本 三者相同
cuda12.8.1 / rocm7.2.3 GPU 加速栈版本 NVIDIA 用 CUDA,AMD 用 ROCm,CPU 镜像无此字段
py312 Python 3.12 三者相同
torch2.3.1 / 2.10.0 / 2.11.0 预装 PyTorch 版本 CPU 镜像的 torch 版本明显更保守
1.39.0 ModelScope Library 版本 三者相同

CUDA 和 ROCm 的区别是新手最容易踩坑的地方,单独说一句:

  • PyTorch 层面的代码(model.to("cuda")torch.cuda 系列 API)在 ROCm 环境下基本原样可用,PyTorch 官方一直维护 ROCm 后端
  • 第三方算子库(某些定制 attention、融合算子)往往只发布了 CUDA 版本,在 AMD 卡上需要找 ROCm 适配版或自行编译

所以选 AMD 环境前,先确认你依赖的库是否支持 ROCm;纯 PyTorch 标准写法基本可以放心上。


六、三种环境怎么选?

给一张选型流程图,按需求对号入座:

数据处理 / 写代码 / 轻量实验

模型训练 / 推理

支持

不确定

明确你的任务

方式一 CPU环境

模型显存需求 ≤ 24G?

方式二 NVIDIA GPU

依赖库支持 ROCm?

方式三 AMD GPU

先用方式二验证代码再迁移

图下补两句实操建议:

  • 默认从 NVIDIA 环境起步:CUDA 生态资料最多,报错随便一搜就有答案,适合验证代码
  • 代码跑通后再上 AMD:把 192G 显存用在真正装不下的大模型上,好钢用在刀刃上

七、免费额度使用注意事项

免费算力虽香,几条使用习惯能帮你把额度用在刀刃上:

  1. 用完即停:限时额度按使用时长消耗,实验跑完及时停止实例,别让它在后台空转烧小时数
  2. 成果及时带走:重要代码和权重及时 git push 或下载到本地,避免实例释放后数据丢失
  3. 长任务先估时:剩余额度页面实时可见(如 35小时36分钟、100小时00分钟),开跑大任务前先对一眼,别跑到一半断粮
  4. CPU 能干的不碰 GPU:装包、洗数据、画图等操作在 CPU 环境完成,GPU 环境只跑训练/推理本体

八、总结

  • ModelScope Notebook 基于 PAI-DSW,内置 JupyterLab / WebIDE / Terminal,免运维、开箱即用
  • 三种环境:CPU(长期使用)NVIDIA GPU(24G 显存,CUDA 生态)AMD GPU(192G 显存,CDNA 3 / gfx942,ROCm 栈,新上线)
  • 镜像名 = 系统 + 加速栈(CUDA/ROCm)+ Python + PyTorch + ModelScope Library 版本,按字段挑镜像不迷路
  • 选型口诀:轻量活给 CPU,验证代码用 NVIDIA,大模型上 AMD
  • 额度免费但限时,用完即停、成果及时备份

本地没 GPU 不再是跑深度学习的门槛,注册一个账号,浏览器里就能开始你的第一个实验。

更多推荐