QDKT7-1开源大模型、向量模型、向量数据库工具本地部署
系列学习规划:围绕开源项目展开,依次为大模型本地化部署→向量模型本地化部署→向量数据库本地化部署→大模型微调,本教程为核心的大模型部署+向量数据库基础部署内容。
核心说明:仅能部署开源大模型,OpenAI、Claude等闭源模型无模型文件,无法本地化部署。
- 系统:Windows 10及以上、MacOS(任意版本);Windows需有独立显卡(查看GPU显存),Mac无显卡要求。
- 显存/内存:建议最低8GB(可运行1B/3B轻量量化模型),16GB及以上体验更佳;Mac的内存=显存(一体化设计),Windows仅看独立显卡的GPU显存(电脑本身的CPU内存无作用)。
- 硬盘:预留至少20GB空闲空间(存储模型文件和工具)。
- Python环境:版本3.9及以上(检查版本:终端输入python --version/python3 --version),官网直接下载安装即可,勾选「Add Python to PATH」。
- 虚拟环境工具(建议):Anaconda/Miniconda,用于隔离依赖,避免安装包版本冲突,零基础可先安装Anaconda。
- 终端工具:Windows用自带命令提示符/PowerShell,Mac用自带终端,无需额外安装。
- 接口测试工具(可选):Apifox(免费),用于调用本地模型的API接口。
- 其他:网络(部分海外平台需网络支持,国内魔搭平台可直接访问)、文件管理器(显示文件后缀名,方便创建model file等文件)。
- 预训练模型:模型原始版本,仅为训练后的向量参数,无对话能力,类似「毛坯房」。
- Instruct指令微调模型:在预训练模型基础上微调后的版本,支持正常对话,更「听话」,是本地化部署的常用版本。
- GGUF格式:大模型本地部署的主流格式,Olama、LLaMA-CPP等工具均支持,部分模型无此格式需自行转换。
- Embedding模型:向量化模型,用于将文字/图片转换成向量数据,需配合向量数据库使用。
本地化部署的开源模型均从以下平台获取,按零基础友好度排序,优先推荐Olama和魔搭。
|
平台/工具 |
类型 |
核心特点 |
模型数量 |
访问/使用方式 |
|
魔搭(ModelScope) |
国内模型社区 |
阿里系,国内访问顺畅,以中文模型为主,海外模型也有收录,模型库全,支持GGUF格式 |
14万+ |
官网直接访问,注册后可下载 |
|
Hugging Face |
全球模型社区 |
全球最大开源模型社区,模型种类最全,含预训练/微调/各类格式模型 |
234万+ |
需网络支持,注册后可下载 |
|
Olama |
客户端+模型库 |
一键部署工具,内置模型库,支持可视化/终端操作,无需复杂配置,适合零基础 |
海量 |
下载客户端后直接使用,内置模型库 |
核心提示:优先选择GGUF格式的模型,可直接在Olama中部署,无需额外转换;模型名后的B为参数量(1B=10亿参数),零基础建议先选1B/3B/4B轻量模型。
部署前必须计算自己的电脑能运行多大的模型,避免卡顿/无法运行,这是零基础的核心必学知识点,公式和步骤均做通俗简化。
- 参数量(B):模型的核心参数规模,1B=10亿参数,数字越小对显存要求越低。
- 浮点精度(FP32):模型默认的存储精度,1个参数占4个字节,是计算显存的基础。
- 量化压缩:对模型进行压缩,减少显存占用,牺牲少量精度但不影响基础使用,主流为INT8和INT4:
- INT8:1个参数占1个字节,显存占用为FP32的1/4;
- INT4:1个参数占0.5个字节,显存占用为FP32的1/8(精度损失较大,不推荐);
- 零基础优先用INT8量化版模型。
- 缓存占用:模型运行时的计算/缓存空间,需在基础显存上增加20%-50%,零基础按**20%**计算即可。
- Mac:点击桌面右上角「苹果图标」→「关于本机」→「内存」,显示的内存大小即为显存大小(如24GB内存=24GB显存)。
- Windows:右键桌面「此电脑」→「管理」→「设备管理器」→「显示适配器」,查看独立显卡的显存(如RTX3060 12GB=12GB显存)。
例1:3B INT8量化模型,实际所需显存=3×1×1.2=3.6GB → 8GB显存电脑可轻松运行。
例2:4B INT8量化模型,实际所需显存=4×1×1.2=4.8GB → 8GB显存电脑可运行。
例3:12B INT8量化模型,实际所需显存=12×1×1.2=14.4GB → 24GB显存电脑可运行。
核心结论:8GB显存电脑优先选1B/3B/4B INT8量化模型;24GB显存电脑可运行12B以内INT8量化模型。
Olama是零基础的最优选择,无需复杂配置,支持Windows/Mac,一键下载运行模型,步骤全程可视化/终端简单指令,新手可直接上手。
- 下载地址:Olama官方官网(Windows/Mac版本分开,Windows需Win10及以上);
- 安装步骤:
- Mac:下载后将Olama拖入「应用程序」文件夹,双击打开即可;
- Windows:下载后双击安装包,一路「下一步」,无需修改配置,安装完成后自动启动。
- 验证安装:打开终端,输入olama,出现相关指令提示即为安装成功。
- 打开Olama客户端,在模型库中直接搜索轻量模型(如gemini3:1B、gemini3:4B);
- 点击模型右侧「下载」,等待下载完成(800多兆的1B模型几秒即可完成);
- 下载完成后点击「运行」,直接进入对话界面,可开始提问。
- 打开终端(Mac:启动台→终端;Windows:开始菜单→命令提示符);
- 直接输入模型运行指令,无需进入任何目录,回车后自动下载并运行:
|
Bash |
- 等待下载完成(终端有进度条),出现对话提示符后即可直接提问(如「介绍一下你自己」)。
若Olama内置模型库下载失败/卡顿,直接用魔搭的GGUF格式模型,终端输入以下专属指令即可:
|
Bash |
Olama的所有操作均通过终端指令完成,整理零基础常用指令,直接复制即可:
|
操作需求 |
终端指令 |
备注 |
|
运行指定模型 |
olama run 模型名(如gemini3:1B) |
自动下载+运行 |
|
查看已部署模型 |
olama list |
显示所有本地模型的名称/大小 |
|
退出模型对话 |
/bye |
在对话界面输入即可 |
|
重新运行已下载模型 |
olama run 模型名 |
无需再次下载,直接运行 |
核心提示:模型下载完成后,再次运行无需重新下载,直接输入olama run 模型名即可。
部署完成后,可通过API接口调用本地模型,适配各类开发工具/自研程序,以零基础友好的Apifox为例,步骤如下:
- 打开Apifox,点击「新建接口」,选择请求方式为POST;
- 填写接口地址:http://localhost:11434/api/chat(Olama默认暴露的端口,11434为固定端口);
- 选择「Body」→「raw」→「JSON」,粘贴以下JSON参数,修改model为自己的本地模型名:
|
JSON |
- 点击「发送」,即可收到本地模型的返回结果,完成API调用。
常见问题:若提示「端口占用」,检查电脑中是否有其他程序占用11434端口,关闭后重新运行Olama即可。
六、进阶操作:非GGUF模型转GGUF格式(适配Olama)
部分开源模型无GGUF格式,无法直接在Olama中部署,需手动将模型转换为GGUF格式,本部分为进阶内容,零基础可先跳过,熟悉基础部署后再操作,步骤均为复制粘贴指令,无复杂开发。
- 已安装Python(3.9+)和Anaconda(虚拟环境);
- 已从魔搭/Hugging Face下载非GGUF格式的模型文件(如预训练版/PT格式);
- 下载LLaMA-CPP(开源模型格式转换工具,Olama也基于此开发),直接从魔搭/Hugging Face下载压缩包,解压即可。
- 打开终端,输入以下指令创建虚拟环境(命名为llm,Python3.12为例):
|
Bash |
- 激活虚拟环境:
|
Bash |
核心提示:后续所有操作均在激活的虚拟环境中完成。
步骤2:下载非GGUF模型(魔搭ModelScope指令下载)
直接用ModelScope的Python依赖下载模型,比手动下载更高效,终端输入以下指令:
- 安装ModelScope依赖:
|
Bash |
- 下载模型到指定本地文件夹(替换为自己的模型名/文件夹路径):
|
Bash |
- 等待下载完成,模型文件会保存到指定的本地文件夹中。
- 进入LLaMA-CPP的解压目录:
|
Bash |
- 安装LLaMA-CPP的Python依赖:
|
Bash |
终端输入以下转换指令,替换为自己的模型路径/输出路径,直接复制即可:
|
Bash |
- --outtype q8_0:指定为INT8量化,零基础优先用这个;
- 转换完成后,会在指定路径生成GGUF格式的模型文件。
- 在GGUF模型文件的同目录下,创建一个后缀为.model的文件(如qwen3-0.6b.model),用记事本打开,粘贴以下内容,修改模型路径为自己的GGUF文件路径:
|
Plain Text |
- 保存.model文件,回到终端,进入该文件的目录,输入以下指令导入Olama:
|
Bash |
- 导入成功后,输入olama list,即可看到该模型,直接用olama run qwen3:0.6b运行即可。
大模型本地化应用需配合向量数据库,用于存储Embedding模型生成的向量数据,支持快速的向量检索/计算,零基础优先学Milvus(开源、轻量、Python一键部署),核心为本地生成.db向量数据库文件,无需复杂服务配置。
将文字/图片通过Embedding模型转换成向量数据(一堆数字),向量数据库专门用于存储这类数据,且支持向量之间的相似度计算,是搭建本地RAG知识库系统的核心组件(传统Excel/MySQL无法高效存储向量数据)。
全程为复制粘贴代码,无复杂开发,零基础可直接操作。
步骤1:安装Milvus Python依赖(在已激活的Python虚拟环境中)
|
Bash |
- 在本地新建一个文件夹(如milvus_demo),在其中新建一个Python文件,命名为milvus_demo.py;
- 用记事本打开该文件,粘贴以下代码,直接保存(无需修改):
|
Python |
- 打开终端,进入milvus_demo.py所在的文件夹:
|
Bash |
- 运行程序:
|
Bash |
- 终端显示「本地向量数据库创建成功」,即可在该文件夹中看到milvus_demo.db文件,本地向量数据库搭建完成。
- 生成的.db文件为本地向量数据库的核心文件,所有向量数据均存储在该文件中;
- 后续可通过Python代码向该文件中插入/查询/删除向量数据,适配本地Embedding模型和大模型;
- 下节课会基于该数据库,搭建完整的本地RAG知识库系统(本地大模型+Embedding模型+向量数据库)。
整理零基础学员操作中最易遇到的问题,针对性给出解决方法,无需复杂排查:
|
问题现象 |
核心原因 |
零基础解决方案 |
|
Olama客户端下载模型失败/卡顿 |
网络问题/内置库访问慢 |
改用魔搭GGUF模型,输入专属指令olama run modelscope.cn/xxx/模型名:GGUF |
|
终端输入olama无反应 |
Olama未安装/未启动 |
重新安装Olama,安装完成后确保客户端在后台运行 |
|
Python依赖安装报错 |
镜像源问题/版本冲突 |
切换为清华镜像源,或用conda虚拟环境隔离依赖,重新安装 |
|
模型运行时电脑卡顿/风扇狂转 |
模型参数量过大/显存不足 |
换更小的模型(如1B/3B),优先用INT8量化版,关闭其他占用显存的程序(如浏览器/视频) |
|
11434端口占用,API调用失败 |
其他程序占用端口 |
打开任务管理器,关闭占用11434端口的程序,重新运行Olama |
|
非GGUF模型转换失败 |
模型路径填写错误 |
确保转换指令中的模型路径为绝对路径,且模型文件完整无缺失 |
将教程中所有直接复制可用的指令整理成表,按功能分类,零基础可直接粘贴到终端使用,无需记忆:
|
操作 |
指令 |
|
运行模型 |
olama run 模型名(如gemini3:1B) |
|
查看本地模型 |
olama list |
|
魔搭模型运行 |
olama run modelscope.cn/xxx/模型名:GGUF |
|
导入GGUF模型 |
olama create 模型名 -f 模型名.model |
|
操作 |
指令 |
|
创建虚拟环境 |
conda create -n llm python=3.12 |
|
激活虚拟环境 |
conda activate llm |
|
安装ModelScope |
pip install modelscope |
|
安装Milvus |
pip install pymilvus |
|
操作 |
指令 |
|
魔搭模型下载 |
python -m modelscope.cli.model_download 作者/模型名 --local-dir 本地路径 |
|
GGUF格式转换 |
python [convert.py](convert.py) 模型路径 --outfile 输出路径 --outtype q8_0 |
更多推荐
所有评论(0)