系列学习规划:围绕开源项目展开,依次为大模型本地化部署向量模型本地化部署向量数据库本地化部署大模型微调,本教程为核心的大模型部署+向量数据库基础部署内容。

核心说明:仅能部署开源大模型,OpenAI、Claude等闭源模型无模型文件,无法本地化部署。

一、前期准备工作

1. 硬件要求

  • 系统:Windows 10及以上、MacOS(任意版本);Windows需有独立显卡(查看GPU显存),Mac无显卡要求。
  • 显存/内存:建议最低8GB(可运行1B/3B轻量量化模型),16GB及以上体验更佳;Mac的内存=显存(一体化设计),Windows仅看独立显卡的GPU显存(电脑本身的CPU内存无作用)。
  • 硬盘:预留至少20GB空闲空间(存储模型文件和工具)。

2. 软件/工具准备

  1. Python环境:版本3.9及以上(检查版本:终端输入python --version/python3 --version),官网直接下载安装即可,勾选「Add Python to PATH」。
  1. 虚拟环境工具(建议):Anaconda/Miniconda,用于隔离依赖,避免安装包版本冲突,零基础可先安装Anaconda。
  1. 终端工具:Windows用自带命令提示符/PowerShell,Mac用自带终端,无需额外安装。
  1. 接口测试工具(可选):Apifox(免费),用于调用本地模型的API接口。
  1. 其他:网络(部分海外平台需网络支持,国内魔搭平台可直接访问)、文件管理器(显示文件后缀名,方便创建model file等文件)。

3. 核心概念前置

  • 预训练模型:模型原始版本,仅为训练后的向量参数,无对话能力,类似「毛坯房」。
  • Instruct指令微调模型:在预训练模型基础上微调后的版本,支持正常对话,更「听话」,是本地化部署的常用版本。
  • GGUF格式:大模型本地部署的主流格式,Olama、LLaMA-CPP等工具均支持,部分模型无此格式需自行转换。
  • Embedding模型:向量化模型,用于将文字/图片转换成向量数据,需配合向量数据库使用。

二、开源模型获取三大核心平台

本地化部署的开源模型均从以下平台获取,按零基础友好度排序,优先推荐Olama和魔搭。

平台/工具

类型

核心特点

模型数量

访问/使用方式

魔搭(ModelScope)

国内模型社区

阿里系,国内访问顺畅,以中文模型为主,海外模型也有收录,模型库全,支持GGUF格式

14万+

官网直接访问,注册后可下载

Hugging Face

全球模型社区

全球最大开源模型社区,模型种类最全,含预训练/微调/各类格式模型

234万+

需网络支持,注册后可下载

Olama

客户端+模型库

一键部署工具,内置模型库,支持可视化/终端操作,无需复杂配置,适合零基础

海量

下载客户端后直接使用,内置模型库

核心提示:优先选择GGUF格式的模型,可直接在Olama中部署,无需额外转换;模型名后的B为参数量(1B=10亿参数),零基础建议先选1B/3B/4B轻量模型。

三、关键知识点:显存计算与量化压缩

部署前必须计算自己的电脑能运行多大的模型,避免卡顿/无法运行,这是零基础的核心必学知识点,公式和步骤均做通俗简化。

1. 核心概念解读

  • 参数量(B):模型的核心参数规模,1B=10亿参数,数字越小对显存要求越低。
  • 浮点精度(FP32):模型默认的存储精度,1个参数占4个字节,是计算显存的基础。
  • 量化压缩:对模型进行压缩,减少显存占用,牺牲少量精度但不影响基础使用,主流为INT8INT4
  • INT8:1个参数占1个字节,显存占用为FP32的1/4;
  • INT4:1个参数占0.5个字节,显存占用为FP32的1/8(精度损失较大,不推荐);
  • 零基础优先用INT8量化版模型
  • 缓存占用:模型运行时的计算/缓存空间,需在基础显存上增加20%-50%,零基础按**20%**计算即可。

2. 显存计算公式(零基础简化版)

基础显存(FP32未量化)= 参数量(B)× 4(GB)

量化后显存(INT8)= 参数量(B)× 1(GB)

实际所需显存= 量化后显存 × 1.2(加20%缓存)

3. 不同系统的显存查看方法

  1. Mac:点击桌面右上角「苹果图标」→「关于本机」→「内存」,显示的内存大小即为显存大小(如24GB内存=24GB显存)。
  1. Windows:右键桌面「此电脑」→「管理」→「设备管理器」→「显示适配器」,查看独立显卡的显存(如RTX3060 12GB=12GB显存)。

4. 实例计算(零基础参考)

例1:3B INT8量化模型,实际所需显存=3×1×1.2=3.6GB → 8GB显存电脑可轻松运行。

例2:4B INT8量化模型,实际所需显存=4×1×1.2=4.8GB → 8GB显存电脑可运行。

例3:12B INT8量化模型,实际所需显存=12×1×1.2=14.4GB → 24GB显存电脑可运行。

核心结论:8GB显存电脑优先选1B/3B/4B INT8量化模型;24GB显存电脑可运行12B以内INT8量化模型

四、零基础快速部署:Olama一键部署法

Olama是零基础的最优选择,无需复杂配置,支持Windows/Mac,一键下载运行模型,步骤全程可视化/终端简单指令,新手可直接上手。

步骤1:下载并安装Olama客户端

  1. 下载地址:Olama官方官网(Windows/Mac版本分开,Windows需Win10及以上);
  1. 安装步骤:
  • Mac:下载后将Olama拖入「应用程序」文件夹,双击打开即可;
  • Windows:下载后双击安装包,一路「下一步」,无需修改配置,安装完成后自动启动。
  1. 验证安装:打开终端,输入olama,出现相关指令提示即为安装成功。

步骤2:模型部署与运行(两种方式,零基础选其一即可)

方式1:Olama客户端可视化操作(最简便)

  1. 打开Olama客户端,在模型库中直接搜索轻量模型(如gemini3:1Bgemini3:4B);
  1. 点击模型右侧「下载」,等待下载完成(800多兆的1B模型几秒即可完成);
  1. 下载完成后点击「运行」,直接进入对话界面,可开始提问。

方式2:终端指令操作(更稳定,推荐)

  1. 打开终端(Mac:启动台→终端;Windows:开始菜单→命令提示符);
  1. 直接输入模型运行指令,无需进入任何目录,回车后自动下载并运行:

Bash
# 示例:运行1B的Gemini3模型,零基础优先用这个
olama run gemini3:1B
# 也可运行4B模型
olama run gemini3:4B

  1. 等待下载完成(终端有进度条),出现对话提示符后即可直接提问(如「介绍一下你自己」)。

步骤3:网络不行的备选方案(魔搭GGUF模型+专属指令)

若Olama内置模型库下载失败/卡顿,直接用魔搭的GGUF格式模型,终端输入以下专属指令即可:

Bash
olama run modelscope.cn/作者名/模型名:GGUF
# 示例:魔搭上的Gemini3 4B GGUF模型
olama run modelscope.cn/xxx/gemini3:4b-gguf

步骤4:核心操作指令(模型管理)

Olama的所有操作均通过终端指令完成,整理零基础常用指令,直接复制即可:

操作需求

终端指令

备注

运行指定模型

olama run 模型名(如gemini3:1B)

自动下载+运行

查看已部署模型

olama list

显示所有本地模型的名称/大小

退出模型对话

/bye

在对话界面输入即可

重新运行已下载模型

olama run 模型名

无需再次下载,直接运行

核心提示:模型下载完成后,再次运行无需重新下载,直接输入olama run 模型名即可。

五、本地模型API调用(Apifox为例,零基础可做)

部署完成后,可通过API接口调用本地模型,适配各类开发工具/自研程序,以零基础友好的Apifox为例,步骤如下:

  1. 打开Apifox,点击「新建接口」,选择请求方式为POST
  1. 填写接口地址:http://localhost:11434/api/chat(Olama默认暴露的端口,11434为固定端口);
  1. 选择「Body」→「raw」→「JSON」,粘贴以下JSON参数,修改model为自己的本地模型名

JSON
{
    "model": "gemini3:1B", // 替换为自己的模型名,如gemini3:4B
    "messages": [
        {
            "role": "user",
            "content": "介绍一下你自己" // 替换为自己的问题
        }
    ],
    "stream": false // 关闭流式输出,直接返回完整结果,零基础推荐
}

  1. 点击「发送」,即可收到本地模型的返回结果,完成API调用。

常见问题:若提示「端口占用」,检查电脑中是否有其他程序占用11434端口,关闭后重新运行Olama即可。

六、进阶操作:非GGUF模型转GGUF格式(适配Olama)

部分开源模型无GGUF格式,无法直接在Olama中部署,需手动将模型转换为GGUF格式,本部分为进阶内容,零基础可先跳过,熟悉基础部署后再操作,步骤均为复制粘贴指令,无复杂开发。

核心前提

  1. 已安装Python(3.9+)和Anaconda(虚拟环境);
  1. 已从魔搭/Hugging Face下载非GGUF格式的模型文件(如预训练版/PT格式);
  1. 下载LLaMA-CPP(开源模型格式转换工具,Olama也基于此开发),直接从魔搭/Hugging Face下载压缩包,解压即可。

步骤1:创建并激活Python虚拟环境(避免依赖冲突)

  1. 打开终端,输入以下指令创建虚拟环境(命名为llm,Python3.12为例):

Bash
conda create -n llm python=3.12

  1. 激活虚拟环境:

Bash
conda activate llm

核心提示:后续所有操作均在激活的虚拟环境中完成。

步骤2:下载非GGUF模型(魔搭ModelScope指令下载)

直接用ModelScope的Python依赖下载模型,比手动下载更高效,终端输入以下指令:

  1. 安装ModelScope依赖:

Bash
pip install modelscope

  1. 下载模型到指定本地文件夹(替换为自己的模型名/文件夹路径):

Bash
python -m modelscope.cli.model_download 模型作者/模型名 --local-dir 本地文件夹路径(如./local_llm)
# 示例:下载千问3 0.6B非GGUF模型
python -m modelscope.cli.model_download qwen/Qwen3-0.6B --local-dir ./local_llm

  1. 等待下载完成,模型文件会保存到指定的本地文件夹中。

步骤3:安装LLaMA-CPP依赖(格式转换工具)

  1. 进入LLaMA-CPP的解压目录:

Bash
cd LLaMA-CPP解压路径(如./llama.cpp)

  1. 安装LLaMA-CPP的Python依赖:

Bash
pip install -r requirements.txt

步骤4:将非GGUF模型转换为GGUF格式

终端输入以下转换指令,替换为自己的模型路径/输出路径,直接复制即可:

Bash
python convert.py 非GGUF模型文件路径 --outfile 输出GGUF模型路径 --outtype q8_0(INT8量化)
# 示例:将千问3 0.6B转换为INT8量化的GGUF模型
python convert.py ./local_llm/Qwen3-0.6B --outfile ./llama.cpp/qwen3-0.6b.gguf --outtype q8_0

  • --outtype q8_0:指定为INT8量化,零基础优先用这个;
  • 转换完成后,会在指定路径生成GGUF格式的模型文件。

步骤5:将转换后的GGUF模型导入Olama

  1. 在GGUF模型文件的同目录下,创建一个后缀为.model的文件(如qwen3-0.6b.model),用记事本打开,粘贴以下内容,修改模型路径为自己的GGUF文件路径

Plain Text
FROM 本地GGUF模型文件的绝对路径(如/Users/xxx/llama.cpp/qwen3-0.6b.gguf)

  1. 保存.model文件,回到终端,进入该文件的目录,输入以下指令导入Olama:

Bash
olama create 模型名 -f 模型名.model
# 示例:将转换后的模型命名为qwen3:0.6b,导入Olama
olama create qwen3:0.6b -f qwen3-0.6b.model

  1. 导入成功后,输入olama list,即可看到该模型,直接用olama run qwen3:0.6b运行即可。

七、向量数据库本地化部署(Milvus为例,零基础友好)

大模型本地化应用需配合向量数据库,用于存储Embedding模型生成的向量数据,支持快速的向量检索/计算,零基础优先学Milvus(开源、轻量、Python一键部署),核心为本地生成.db向量数据库文件,无需复杂服务配置。

1. 向量数据库核心作用

将文字/图片通过Embedding模型转换成向量数据(一堆数字),向量数据库专门用于存储这类数据,且支持向量之间的相似度计算,是搭建本地RAG知识库系统的核心组件(传统Excel/MySQL无法高效存储向量数据)。

2. Milvus本地基础部署步骤(Python一键搭建)

全程为复制粘贴代码,无复杂开发,零基础可直接操作。

步骤1:安装Milvus Python依赖(在已激活的Python虚拟环境中)

Bash
pip install pymilvus

步骤2:创建Python程序生成本地向量数据库文件

  1. 在本地新建一个文件夹(如milvus_demo),在其中新建一个Python文件,命名为milvus_demo.py
  1. 用记事本打开该文件,粘贴以下代码,直接保存(无需修改):

Python
# 导入Milvus客户端
from pymilvus import MilvusClient
# 创建本地客户端,生成milvus_demo.db向量数据库文件,保存在当前目录
client = MilvusClient("./milvus_demo.db")
# 打印成功提示
print("本地向量数据库创建成功!生成的文件为:milvus_demo.db")

步骤3:运行Python程序,生成本地DB文件

  1. 打开终端,进入milvus_demo.py所在的文件夹:

Bash
cd ./milvus_demo

  1. 运行程序:

Bash
python milvus_demo.py

  1. 终端显示「本地向量数据库创建成功」,即可在该文件夹中看到milvus_demo.db文件,本地向量数据库搭建完成。

3. 核心说明

  1. 生成的.db文件为本地向量数据库的核心文件,所有向量数据均存储在该文件中;
  1. 后续可通过Python代码向该文件中插入/查询/删除向量数据,适配本地Embedding模型和大模型;
  1. 下节课会基于该数据库,搭建完整的本地RAG知识库系统(本地大模型+Embedding模型+向量数据库)。

八、常见问题与零基础解决方案

整理零基础学员操作中最易遇到的问题,针对性给出解决方法,无需复杂排查:

问题现象

核心原因

零基础解决方案

Olama客户端下载模型失败/卡顿

网络问题/内置库访问慢

改用魔搭GGUF模型,输入专属指令olama run modelscope.cn/xxx/模型名:GGUF

终端输入olama无反应

Olama未安装/未启动

重新安装Olama,安装完成后确保客户端在后台运行

Python依赖安装报错

镜像源问题/版本冲突

切换为清华镜像源,或用conda虚拟环境隔离依赖,重新安装

模型运行时电脑卡顿/风扇狂转

模型参数量过大/显存不足

换更小的模型(如1B/3B),优先用INT8量化版,关闭其他占用显存的程序(如浏览器/视频)

11434端口占用,API调用失败

其他程序占用端口

打开任务管理器,关闭占用11434端口的程序,重新运行Olama

非GGUF模型转换失败

模型路径填写错误

确保转换指令中的模型路径为绝对路径,且模型文件完整无缺失

九、核心指令速查表(零基础收藏)

将教程中所有直接复制可用的指令整理成表,按功能分类,零基础可直接粘贴到终端使用,无需记忆:

Olama常用指令

操作

指令

运行模型

olama run 模型名(如gemini3:1B)

查看本地模型

olama list

魔搭模型运行

olama run modelscope.cn/xxx/模型名:GGUF

导入GGUF模型

olama create 模型名 -f 模型名.model

Python/虚拟环境常用指令

操作

指令

创建虚拟环境

conda create -n llm python=3.12

激活虚拟环境

conda activate llm

安装ModelScope

pip install modelscope

安装Milvus

pip install pymilvus

模型下载/转换常用指令

操作

指令

魔搭模型下载

python -m modelscope.cli.model_download 作者/模型名 --local-dir 本地路径

GGUF格式转换

python [convert.py](convert.py) 模型路径 --outfile 输出路径 --outtype q8_0

更多推荐