LLaMA-Factory 快速入门(一):Mac 下大模型微调后通过命令行部署的方法

环境准备与依赖安装

确保Mac系统已安装Python 3.8或更高版本,建议通过Homebrew管理依赖。终端输入以下命令安装基础工具链:

brew install cmake git-lfs
pip install torch transformers sentencepiece

若需启用GPU加速(仅限M1/M2芯片),需额外安装metal-performance-shaders

pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/nightly/cpu

模型微调配置

下载LLaMA-Factory项目并进入工作目录:

git clone https://github.com/hiyouga/LLaMA-Factory.git
cd LLaMA-Factory

修改train_llama.sh脚本中的参数:

  • --model_name_or_path 指定基础模型路径(如decapoda-research/llama-7b-hf
  • --data_path 设置训练数据集路径(JSON格式)
  • --output_dir 定义微调后模型输出目录
执行微调任务

运行以下命令启动微调(需8GB以上显存):

bash train_llama.sh

若显存不足,可添加--quantization_bit 4启用4比特量化。训练日志会实时输出至终端,完成后在output_dir生成适配器权重(adapter_model.bin)。

命令行部署与推理

将微调后的模型合并至基础模型:

python scripts/merge_weights.py \
  --base_model decapoda-research/llama-7b-hf \
  --adapter_model ./output_dir

使用transformers库进行交互式推理:

from transformers import pipeline
generator = pipeline("text-generation", model="merged_model_path")
print(generator("用户输入文本", max_length=50))

性能优化技巧
  • 启用--use_fast_tokenizer加速分词处理
  • 添加--fp16参数减少显存占用
  • 通过--batch_size调整批次大小平衡速度与资源消耗
常见问题排查
  • 报错OSError: Unable to load model:检查模型路径权限,确保完整下载
  • 推理结果异常:验证训练数据格式是否正确,避免特殊字符污染
  • GPU内存溢出:降低max_length或启用--quantization_bit 8

以上步骤覆盖从环境配置到生产部署的全流程,适用于大多数NLP微调场景。实际应用时需根据硬件条件和任务需求调整超参数。

更多推荐