
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
GPU 实例创建后别急着跑训练:5 分钟完成显卡、CUDA、PyTorch、磁盘与网络验机
GPU 是不是我选的那张卡?驱动和 CUDA 是否可用?PyTorch 是否真的在使用 GPU?磁盘、内存和网络是否满足任务?出问题时,我有没有留下足够的环境信息?把这几项做完,再启动训练、推理或渲染,通常比直接开跑更稳妥。先验机,后训练;先留证,后排障。本文中的命令用于通用 Linux/GPU 环境检查,具体输出会因操作系统、驱动、镜像和平台配置不同而变化。
用 vLLM 把开源大模型部署成高并发 API(含显存优化踩坑)
最近要把一个 Qwen2-72B 的模型对外提供推理服务,本地那张 3090 直接劝退——72B 哪怕 4bit 量化也得 40G+ 显存,更别提并发了。折腾了一圈 vLLM,把部署流程和几个显存优化的坑记下来,给同样要上生产的人参考。
到底了







