LlamaAI本地部署实战专栏第3篇

从下载第一个模型开始,让你的电脑真正运行属于自己的本地AI。


一、终于到了运行模型这一步

在前两篇文章中,我们完成了:

✅ 了解本地大模型发展趋势
✅ 编译llama.cpp运行环境
✅ 配置Windows/Linux开发环境

但是目前我们的环境只是:


llama.cpp推理引擎

        +

空环境

它还不会回答问题。

真正的AI系统还需要:


用户输入

↓

llama.cpp

↓

大语言模型

↓

生成回答

所以今天我们正式加载第一个模型。


二、什么是大语言模型?

很多初学者第一次接触本地部署,会疑惑:

为什么下载一个模型文件就可以聊天?

实际上,一个大语言模型本质上是一组巨大的数学参数。

例如:

Llama 3 8B:


8 Billion Parameters

≈ 80亿个参数

这些参数存储了模型学习到的:

  • 语言规律
  • 知识关系
  • 推理能力

简单理解:


训练阶段:

大量文本

↓

神经网络学习

↓

生成模型参数


部署阶段:

模型参数

↓

输入问题

↓

预测下一个Token

↓

输出答案

三、为什么选择GGUF模型?

原始模型通常是:


PyTorch格式

.pth

.bin

.safetensors

例如:


Qwen2.5-7B

↓

14GB+

普通电脑很难运行。

因此需要进行:

模型量化(Quantization)

原理:

降低参数精度:


FP32

↓

FP16

↓

INT8

↓

INT4

例如:

模型 大小
FP16 7B 14GB
Q8 7B 8GB
Q4 7B 4GB

而llama.cpp主要使用:

GGUF格式模型

结构:


原始模型

↓

量化

↓

GGUF

↓

llama.cpp加载

四、选择第一个本地模型

对于第一次部署,不建议直接使用几十B的大模型。

推荐:

方案1:Qwen系列(中文优秀)

Alibaba Cloud 开源的Qwen系列模型目前在中文任务中表现优秀。

推荐:

模型 大小 适合
Qwen2.5-1.5B 约1GB 普通电脑
Qwen2.5-3B 约2GB 轻量AI助手
Qwen2.5-7B Q4 约4GB 推荐入门

方案2:Llama系列

Meta Platforms 发布的Llama系列是目前最具影响力的开源大模型之一。

推荐:

模型 特点
Llama 3.1 8B 综合能力强
Llama 3.2 3B 轻量部署

五、下载GGUF模型

推荐模型来源:

Hugging Face

例如搜索:


Qwen2.5-7B-Instruct-GGUF

下载:


Q4_K_M.gguf

为什么选择Q4_K_M?

因为它:

  • 速度快
  • 精度损失小
  • 显存占用低

下载完成:

例如:


models/

└── qwen2.5-7b-q4_k_m.gguf

六、使用llama-cli运行第一个模型

进入:


llama.cpp

运行:

Linux:


./build/bin/llama-cli \
-m models/qwen2.5-7b.gguf

Windows:


llama-cli.exe `
-m models/qwen2.5-7b.gguf

启动后:


>

输入:


你好,请介绍一下自己

输出:


你好,我是一个人工智能助手...

恭喜:

你的第一台本地AI已经运行成功。


七、理解llama-cli运行参数

实际部署中,经常需要调整参数。


1. 指定模型

参数:


-m

例如:


-m qwen.gguf

表示:

加载哪个模型。


2. 设置上下文长度

参数:


-c

例如:


-c 4096

表示:

模型一次最多处理多少Token。

关系:


context越大

↓

记忆内容越多

↓

显存占用越高

3. GPU加速

参数:


-ngl

全称:


number of gpu layers

例如:


-ngl 50

表示:

加载50层到GPU。

如果显存足够:


-ngl 999

全部放GPU。


4. 温度参数

参数:


--temp

控制创造性。

例如:


--temp 0.7

效果:

低:


更稳定
更准确

高:


更随机
更有创造力

八、第一次体验:打造本地ChatGPT

启动:


./llama-cli \
-m qwen.gguf \
-c 4096 \
-ngl 50 \
--temp 0.7

测试问题:


测试1:知识问答

输入:


解释Transformer架构

测试2:代码能力

输入:


写一个Python快速排序

测试3:中文能力

输入:


帮我写一篇人工智能介绍

九、模型运行原理

一次回答实际上经历:


用户输入

↓

Tokenizer

↓

Token ID

↓

Transformer网络

↓

预测概率

↓

选择Token

↓

循环生成

↓

文本输出

例如:

输入:


中国的首都是

模型预测:


北京
上海
广州

然后根据概率选择:


北京

继续生成。


十、显存和模型选择建议

很多新人最容易踩坑:

我的显卡为什么运行不了?

参考:

显存 推荐模型
4GB 1.5B~3B Q4
8GB 7B Q4
12GB 7B Q8
16GB 13B Q4
24GB 30B部分量化

十一、CPU运行优化

没有GPU也可以运行。

参数:


--threads

例如:


--threads 8

指定CPU线程。

同时:

选择小模型:


1.5B

3B

体验会更好。


十二、常见问题解决

问题1:模型加载失败

错误:


failed to load model

检查:

  • 文件路径
  • 模型是否完整
  • GGUF格式是否正确

问题2:速度非常慢

原因:

模型跑在CPU。

查看:


nvidia-smi

如果没有显存占用:

说明GPU没有使用。

解决:

增加:


-ngl

问题3:回答乱码

原因:

模型不是中文模型。

建议:

使用:

  • Qwen
  • DeepSeek
  • Yi

十三、本篇总结

今天完成:

✅ 理解大语言模型结构
✅ 认识GGUF格式
✅ 学会下载模型
✅ 使用llama.cpp运行模型
✅ 掌握核心参数
✅ 成功运行第一个本地AI

现在你的电脑已经具备:


本地模型

+

推理引擎

+

聊天能力

下一步,我们继续提升性能。


下一篇预告:

《让本地LLM速度提升10倍:llama.cpp CUDA GPU加速实战》

下一篇内容:

  • CUDA是什么
  • 为什么GPU适合大模型
  • llama.cpp CUDA编译
  • GPU显存分析
  • RTX4060/4090实测优化
  • token/s性能提升方法

让你的本地AI真正跑起来。

更多推荐