手把手教你用 LLaMA-Factory 微调专属大模型,AMD 平台也能行
环境搭建与模型准备
在 AMD 平台上跑通大模型微调,最大的门槛往往不是算法本身,而是环境配置。很多习惯了 NVIDIA CUDA 生态的朋友,初次接触 ROCm 时容易在驱动版本和依赖库上栽跟头。其实只要理清顺序,AMD Instinct GPU 配合 ROCm 7.x 完全能胜任 LLaMA-Factory 的微调任务。
首先,确保你的系统内核较新(推荐 Ubuntu 22.04 LTS),并将当前用户加入 video 和 render 用户组,这是 GPU 被正确识别的前提。安装完 ROCm 驱动后,不要急着装 Python 库,先用 rocm-smi 命令看看显卡状态。如果能看到温度、显存占用等详细信息,说明底层驱动工作正常。接着验证 hipcc 编译器是否可用,这一步能提前排除大部分硬件识别问题。
环境校验通过后,建议用 Conda 创建一个干净的 Python 3.10 虚拟环境。LLaMA-Factory 的安装非常直接:
git clone https://github.com/hiyouga/LLaMA-Factory.git
cd LLaMA-Factory
pip install -e '.[torch,metrics]'
安装完成后,运行 llamafactory-cli train -h,如果能打印出帮助信息,说明工具链已就绪。接下来是模型准备,虽然支持直接从 Hugging Face 下载,但为了稳定性和复用性,强烈建议手动下载 Meta-Llama-3-8B-Instruct 到本地目录。下载完后,务必用官方提供的简单推理脚本跑一次,确认模型文件完整且能被 Transformers 加载,避免后续训练因文件损坏而中途报错。
数据集构建与参数详解
微调效果的好坏,一半取决于数据。LLaMA-Factory 支持多种格式,对于指令微调(SFT),最常用的是 Alpaca 格式。你需要构建一个 JSON 列表,每个样本包含 instruction(指令)、input(可选输入)和 output(期望输出)。
例如,如果你想训练一个专门生成商品文案的模型,数据长这样:
[
{
"instruction": "为这款无线耳机写一段吸引人的电商文案",
"input": "产品名称:SoundFree Pro,特点:降噪、续航 30 小时",
"output": "沉浸在纯净音质中,SoundFree Pro 带你逃离喧嚣。主动降噪技术隔绝外界干扰,30 小时超长续航让音乐永不掉线。"
}
]
注意,instruction 和 output 是必填项,input 可以为空。如果是多轮对话数据,还可以加上 history 字段。准备好数据后,需要在 data/dataset_info.json 中注册你的数据集名称,告诉框架去哪里找这些文件。
启动训练时,template 参数至关重要。不同模型的对话格式差异很大,Llama 3 有自己特殊的标记符。如果在命令中不指定 --template llama3,模型可能会把提示词当成普通文本处理,导致生成的内容混乱或重复。务必查阅项目文档,确保为你的基座模型选择了正确的模板。
启动微调与模型导出
一切准备就绪,就可以开始 LoRA 微调了。LoRA 是一种高效微调技术,它只训练少量参数,极大地降低了显存需求,让单张 Radeon 显卡也能跑起来。使用命令行启动任务:
llamafactory-cli train \
--model_name_or_path /path/to/Meta-Llama-3-8B-Instruct \
--dataset my_custom_data \
--template llama3 \
--finetuning_type lora \
--output_dir ./saved_models/llama3-lora \
--per_device_train_batch_size 2 \
--gradient_accumulation_steps 4 \
--learning_rate 1e-4 \
--num_train_epochs 3
训练过程中,可以通过日志观察 loss 下降情况。训练结束后,你得到的是 LoRA 权重文件,它不能独立运行,需要合并回基座模型。LLaMA-Factory 提供了便捷的导出命令:
llamafactory-cli export \
--model_name_or_path /path/to/Meta-Llama-3-8B-Instruct \
--adapter_name_or_path ./saved_models/llama3-lora \
--export_dir ./merged_model \
--export_size 2
这会将微调后的权重合并成一个完整的模型目录。为了方便在本地或端侧设备部署,我们可以进一步将其转换为 GGUF 格式。GGUF 是 Ollama 等推理引擎通用的格式,量化后体积更小,推理速度更快。使用内置的量化导出功能,选择 q4_k_m 等量化等级,即可生成适合消费级显卡甚至 CPU 运行的模型文件。
最后,用 Ollama 加载这个 GGUF 文件,你就能在本地终端里与那个“懂你业务”的专属大模型对话了。从环境搭建到最终推理,这套流程在 AMD 平台上已经相当成熟,关键在于细心配置每一个环节。当你看到模型准确输出预期的垂直领域内容时,所有的配置折腾都是值得的。
🎁 开发者“神装”补给站|CSDN 6 月宠粉专属福利
工欲善其事,必先利其器。为了帮大家扫清 AI 实践的障碍,CSDN AI 开发者计划,在文末为大家准备了一份「AI 开发者能量包」!
更多推荐



所有评论(0)