一、环境准备

个人环境:Win10、Python 3.9
硬件配置:4GB 显存、8 核 CPU、16G 内存,512+1024 固态硬盘
在这里插入图片描述
建议模型配置:7B
7B,约 28.81 tokens/s【使用ollama run qwen2.5:7b --verbose计算】
在这里插入图片描述

  1. 下载 Ollama 安装包:https://ollama.com/【如果太慢,可以选择手机开个代理,下载完传回电脑安装】
  2. 在安装包目录下打开 CMD,输入 OllamaSetup.exe /DIR=D:\Ollama。避免安装在 C 盘,安装完成后无需登录,选择本地使用即可。
  3. 配置ollama 模型安装目录
    1. D:\Ollama 下新建 models文件夹
    2. 配置系统环境变量
      在这里插入图片描述
  4. 配置ollama 主机地址
    在这里插入图片描述
  5. 开放http请求
    在这里插入图片描述

二、验证安装结果

1、 cmd 输入ollama -v 查看
在这里插入图片描述
@TOC
1、ollama官网搜索你想本地部署的大模型
在这里插入图片描述
3、以qwen3.8 27b版本举例,复制cli命令行执行(执行前,run换成pull,如果报错中断了,pull支持断点续传,如果下载慢,需要一些小魔法🤣)
在这里插入图片描述
等待安装完毕即可
在这里插入图片描述
3、下载完毕后,执行ollama run 模型名称,将会自动运行大模型。

三、拉取大模型【魔搭社区版】

如果频繁出现卡顿,长时间未下载完毕,可考虑该版本。

1、以Qwen_Qwen3.5-9B-GGUF模型为例,打开魔搭社区 搜索相关模型的GGUF版本,前面的bit是参数位宽,根据自己机器的性能选择,位宽太高容易带不动,太低会胡说八道。所以我选择IQ4_XS,点击直接下载即可。
在这里插入图片描述

2、下载完毕后,将GGUF包,挪到D:\Ollama\models,文件夹中,并增加Modelfile配置:

# Modelfile | Qwen_Qwen3.5-9B-IQ4_XS.gguf
# 适配硬件:GTX1650Ti‑4G显存、整机16G内存;用于论文写作场景
FROM ./Qwen_Qwen3.5-9B-IQ4_XS.gguf

# num_gpu:将前15层模型加载进NVIDIA显存;4G显存安全上限,防止爆显存报错
PARAMETER num_gpu 16
# num_ctx:上下文窗口最大token数≈8192,单次可处理约6000汉字;不要设置过高,避免内存暴涨
PARAMETER num_ctx 8192
# num_thread:CPU推理线程数,控制后台CPU负载,降低内存占用峰值
PARAMETER num_thread 7

# Qwen系列标准对话模板,格式不可修改;负责拼接系统提示词、用户提问、模型回复
TEMPLATE """{{ .System }}
用户: {{ .Prompt }}
助手:"""

# 系统人设:CryAI助手,学术论文专用提示词,严谨作答,不确定内容主动标注风险
SYSTEM "你是 CryAI 大模型助手,请以严谨学术文风直接输出最终回答,**禁止输出草稿、推理过程、自检步骤等中间内容,不要展示思考过程,输出简洁正式。遇到不确定的内容务必标注疑点,提示用户复核信息。**"

3、执行ollama导入命令(执行前将其他进程应用全部关闭,防止内存不足【内存充足的大佬请忽略】)

ollama create Qwen3.5-9B-IQ4_XS -f Modelfile

在这里插入图片描述
4、运行大模型并检查参数是否正确
执行命令:ollama run Qwen3.5-9B-IQ4_XS:latest后,输入/show parameters
在这里插入图片描述
5、如果需要修改Modelfile内容,重新create加载一下即可
在这里插入图片描述

更多推荐