Llama-Factory 本地部署并通过 Web 启动
镜像
Miniconda conda3
Python 3.10(ubuntu22.04)
CUDA 11.8
GPU RTX 3090(24GB) * 1
CPU 15 vCPU Intel® Xeon® Platinum 8358P CPU @ 2.60GHz
内存 90GB
硬盘
系统盘 30 GB
数据盘 免费:50GB
环境准备
部署前需确认硬件和基础软件满足要求。
硬件要求:
- 微调模型建议至少 24GB 显存(以 7B 模型为例),纯推理可适当降低
- 推荐使用支持 CUDA 的 NVIDIA GPU
软件依赖:
- Python 3.12(与 LLaMA-Factory 兼容性最佳)
- CUDA 12.2 或兼容版本
- PyTorch 2.1.2+
安装步骤
1. 创建并激活 Conda 环境
conda create -n llamafactory python=3.12
conda activate llamafactory
2. 克隆 LLaMA-Factory 仓库
git clone --depth 1 https://github.com/hiyouga/LLaMA-Factory.git
cd LLaMA-Factory
--depth 1 仅克隆最新版本,可节省时间和空间。
3. 安装依赖
pip install -e ".[torch,metrics]"
- 网络较慢时可配置国内镜像源加速
- 若提示
pip: command not found,请先执行conda install pip
4. 验证安装
llamafactory-cli version
正常显示版本号即表示安装成功。
下载基座模型
模型可从 Hugging Face 或 ModelScope 下载。
方式一:从 Hugging Face 下载
# 设置镜像站(国内推荐)
export HF_ENDPOINT=https://hf-mirror.com
# 下载模型(以 Qwen3-0.6B 为例)
hf download --resume-download Qwen/Qwen3-0.6B --local-dir ./models/Qwen3-0.6B
--local-dir 指定本地存放目录。
方式二:使用 ModelScope Python SDK(推荐)
适合网络不稳定环境,操作稳定可控。
-
安装 SDK:
pip install modelscope -
创建下载脚本
download_model.py:from modelscope import snapshot_download model_id = "qwen/Qwen2.5-3B-Instruct" # 替换为目标模型ID cache_dir = "./models" # 替换为本地存放路径 model_dir = snapshot_download(model_id, cache_dir=cache_dir) print(f"模型已下载至: {model_dir}")模型 ID 格式为“组织/模型名”,如
01ai/Yi-1.5-6B-Chat、deepseek-ai/DeepSeek-Coder-V2-Lite-Instruct。 -
执行脚本:
python download_model.py
方式三:使用 ModelScope 命令行工具
modelscope download --model Qwen/Qwen2.5-3B-Instruct --local_dir ./my_model_dir
下载后的使用
记住模型文件的存放路径(如 ./models 或 ./my_model_dir),后续在 LLaMA-Factory 配置文件或 Web UI 中设置模型路径时,直接指向该本地目录即可,框架会自动读取。
启动服务
LLaMA-Factory 提供 Web UI 可视化界面,操作直观,适合快速体验与调试。
export GRADIO_SERVER_PORT=6006
llamafactory-cli webui
启动后,在浏览器访问 http://localhost:6006 即可使用。
更多推荐




所有评论(0)