降低公有云的GPU/NPU环境云账单费用
提供一点 我个人的经验。
备注:目前实际上只有英伟达可用,昇腾在任何一朵云上都找不到
_1、公有云定制和私有数据中心(公司或家庭机房)一样的操作系统。将大部分问题放在私有数据中心解决,公有云仅仅解决GPU/NPU的问题。
采用定制操作系统 将使自己拥有一个统一的混合多云的GPU/NPU环境,各大 公有云的GPU都可以随便使用。
定制操作系统更加接近 客户私有数据中心的实际情况。
公有云提供的镜像操作系统要么是自己的独门暗器,要么就是老掉牙的操作系统、GPU/NPU驱动(无法支持最新的模型运行软件),
阿里云也能提供rocky linux 这样非常新的镜像,但是它在线安装什么都会报 SSL的错误,是相当不靠谱。有了定制镜像,这些不稳定网络问题
都可以转换为 离线安装。
华为云能够独立(不借助任何工具)完成操作系统定制,并且可以给其它的公有云使用。
_2、人工智能应用及智能体开发 采用CPU 运行模型,只有在测试完了后,再移到 公有云的GPU/NPU环境。
个人在淘宝上购买 服务器,不要购买特别老的机器,比如X 3650(15年及以上历史,实在太老了) ,这个机型的CPU无法支持 最新的vLLM。
比较老的浪潮 NF5180M5 和联想ThinkSystem SR850 可以支持最新的vLLM。
_3、GPU/NPU有不同的档次,先从最便宜的开始。
_4、GPU/NPU每小时收费实在有点贵,可以在集中使用公有云的GPU/NPU的时候,购买一个按月付费的普通的云主机 存放 镜像 、YUM源,提前把部署的shell脚本编写好。
_5、如果对Python、PIP那一套及Ubuntu不熟悉,刚开始不要试图采用Python、PIP那一套在GPU/NPU环境下运行vLLM/SGLang这样的模型运行环境,
先还是使用Docker和Kubernetes 去 运行 vLLM/SGLang这样的软件。麒麟/欧拉/RHEL/Rocky 这系LINUX很可能有些库不满足vLLM/SGLang,
需要从源码编译和安装,至少我试的Rocky LINUX 9.5是这样的。如果非要用Python、PIP那一套运行vLLM/SGLang,
可以通过其它的用Python开发的智能体开发工具来熟悉Python、PIP那一套部署、编译技术。
更多推荐
所有评论(0)