如果你还在纠结「要不要把大模型部署到本地」,或是对着满屏的技术术语犯怵,担心自己「零基础搞不定」,那这篇文章就是为你量身打造的。

如今大模型应用越来越广,但要么依赖云端 API 担心数据泄露、要么按 Token 付费越用越贵、要么断网就歇菜 —— 这些痛点,其实只要把模型部署在自己的电脑上,就能一次性解决。不用怕复杂,我们不讲晦涩的理论,只把「从 0 到 1 跑通本地大模型」的步骤拆细,哪怕你刚接触命令行,跟着做也能搞定。

不管你是想低成本用 AI 处理私密数据,还是单纯想折腾下自家电脑的算力,看完这篇,你就能清楚知道:自己的电脑能跑什么模型、该选哪种部署方式,以及遇到问题该怎么解决。


1 为什么要本地部署大模型

1.1 本地部署 vs 云端部署:一张表看懂优劣

在开始动手之前,我们先搞清楚一个问题:为什么要把大模型部署到自己的电脑上,而不是直接用 ChatGPT、DeepSeek 这些云端服务?

对比维度

本地部署

云端部署

数据隐私

数据完全不出本机,适合涉密场景

数据发送到云端服务器,存在泄露风险

使用成本

一次部署,无限调用,无 Token 费用

按量付费,高频使用成本高

网络依赖

完全离线可用,断网也能跑

必须联网,网络波动影响体验

响应延迟

无网络延迟,本地推理通常在 20-100ms

受网络影响,100-1000ms 不等

模型选择

可选择任意开源模型并自由切换

只能使用平台提供的模型

性能上限

受限于你的硬件(显卡/内存)

云端算力几乎无限

部署门槛

需要一定的动手能力(本文帮你解决)

注册账号即可使用

定制能力

可自由微调、修改模型参数、构建 RAG

定制能力有限,受平台约束

这些情况,强烈建议本地部署

① 隐私敏感场景:企业内部文档、医疗记录、法律文书等不能外传的数据

② 离线环境:军工、野外勘探、飞机上等无网络环境

③ 开发调试:需要频繁调参、测试不同模型,API 调用太慢且费钱

④ 成本控制:日均调用量超过 10 万 Token 时,本地部署 3 个月即可回本

⑤ 学习研究:想深入理解大模型工作原理,而非只会调用 API

这些情况,用云端就够了

•  偶尔用用,每天对话不到 100 次

•  电脑配置太低(4GB 内存以下),升级不如用云端

•  想要 GPT-5、Claude 4 这类闭源的最新模型

•  不想折腾,追求即开即用

1.2 显存占用是怎么算的?

新手最懵的点:到底需要多大显存才能跑模型?一句话说透:跑大模型,显存(VRAM)才是核心,CPU 核心数、内存频率真没那么重要。

核心计算公式

所需显存 ≈ 模型参数量 × (量化精度 / 8) × 1.2

简单解释:

  - 模型参数量:比如 7B 就是 70 亿参数

  - 量化精度:FP16 = 16 位(2字节),INT8 = 8 位(1字节),INT4 = 4 位(0.5字节)

  - 1.2:预留 20% 给 KV Cache(键值缓存)和系统开销

不同精度下的显存占用速查表

模型参数量

FP16 权重

INT8 量化

INT4 量化

推理总显存 (INT4)

1B-3B

2-6 GB

1-3 GB

0.5-1.5 GB

2-4 GB

7B-8B

14-16 GB

7-8 GB

3.5-4 GB

4-6 GB

13B-14B

26-28 GB

13-14 GB

6.5-7 GB

8-10 GB

32B-34B

64-68 GB

32-34 GB

16-17 GB

19-24 GB

70B-72B

140-144 GB

70-72 GB

35-36 GB

40-48 GB

注意:上表是使用 INT4 量化后的推理总显存。如果用 FP16 原版精度,显存需求大约是上表的 3-4 倍。

量化是什么?(小白理解版)

把模型想象成一本高清画册:

•  FP16 = 原版高清画册,每张图占 2MB(最清晰,最占空间)

•  INT8 = 压缩版,每张图占 1MB(肉眼几乎看不出区别)

•  INT4 = 高度压缩版,每张图占 0.5MB(略有损失,但大多数场景够用)

对于新手来说,INT4 量化(Q4_K_M)是最推荐的选择——显存占用只有 FP16 的 1/4,但回答质量下降很小(通常 < 5%)。

1.3 如何根据你的显卡选择合适的模型

第一步:查看你的显卡和显存

Windows:打开任务管理器 → 性能 → GPU

Linux:终端输入 nvidia-smi

macOS:左上角苹果菜单 → 关于本机 → 查看"内存"(Apple Silicon 统一内存即显存)

你的显卡

显存

推荐模型(INT4 量化)

预期体验

无独显 / 核显

8-16GB 系统内存

Qwen3.6-4B, Phi-4-mini, Gemma 4-4B

基础对话、摘要、翻译

GTX 1060 / RTX 3050

4-6 GB

Qwen3.6-4B, Gemma 4-4B, Phi-4-mini

日常聊天、文案润色

RTX 3060 12GB / RTX 4060

8-12 GB

Qwen3.6-9B, Mistral-7B, Llama3.1-8B

日常助手、代码提示、翻译

RTX 4060 Ti 16GB / RTX 4070

12-16 GB

Qwen3.6-27B (Q4), DeepSeek-Coder-V3, GLM-9B

代码生成、长文写作、推理

RTX 4070 Ti Super / RTX 4080

16 GB

Qwen3.6-35B-A3B (Q4), DeepSeek-R1-32B

复杂推理、专业代码审查

RTX 4090 / RTX 5080

24 GB

Qwen3.6-35B-A3B (Q5), DeepSeek-V4-Flash, Llama3.1-70B(Q4)

顶级本地体验,接近 GPT-4 水平

RTX 5090 / A5000

24-32 GB

Qwen3.6-122B-A10B (Q4), 70B 量化稳定运行

消费级天花板

Apple M1/M2/M3 (16GB+)

统一内存

Qwen3.6-9B\~27B, Llama3.1-8B

利用 Metal 加速,效果不错

Apple M3 Ultra (64GB+)

统一内存

DeepSeek-V4-Flash, Qwen3.6-122B-A10B

Mac 最强本地 AI 体验

第二步:对照下表选模型

模型

出品方

参数规模

推荐理由

中文支持

开源协议

Qwen3.6

阿里巴巴

0.8B~397B (MoE)

2026年4月最新版,27B 稠密模型编码极强,35B-A3B MoE 速度快到离谱

极佳

Apache 2.0

Qwen3.5

阿里巴巴

0.8B~397B (MoE)

2026年2月发布,全系列原生多模态(文本+图像+视频),DeltaNet 混合架构

极佳

Apache 2.0

Qwen3

阿里巴巴

0.5B~235B (MoE)

生态最完善,硬件兼容性最好,4B 版本可在树莓派运行

极佳

Apache 2.0

DeepSeek V4-Flash

深度求索

284B/13B 激活 (MoE)

2026年4月发布,MIT 协议,1M 超长上下文,性价比之王

极佳

MIT

DeepSeek V4-Pro

深度求索

1.6T/49B 激活 (MoE)

前沿推理能力,SWE-Bench 达 80.6%,接近闭源前沿水平

极佳

MIT

DeepSeek V3/R1

深度求索

671B/37B 激活 (MoE)

推理能力全球顶尖,中文极强,R1 推理链展现完整思考过程

极佳

MIT

GLM-5.1

智谱 AI

744B/40B 激活 (MoE)

2026年4月发布,MIT 协议,200K 上下文,类 Claude Opus 定位

极佳

MIT

GLM-Z1

智谱 AI

9B~32B

中文理解力强,指令遵循度高,推理速度快

极佳

Apache 2.0

Llama 4 (Scout/Maverick)

Meta

17B~109B (MoE)

英文生态最丰富,社区资源最多,最高 512K 超长上下文

良好

Llama 4 Community

Llama 3.1

Meta

8B~405B

社区标准,几乎所有工具/框架最先支持

良好

Llama 3 Community

Mistral Small 3.1

Mistral AI

24B

轻量高效,Apache 2.0 协议,企业友好

良好

Apache 2.0

Mistral (7B)

Mistral AI

7B

轻量级代表,多语言支持好,速度快

良好

Apache 2.0

Gemma 4

Google

2B~31B (含 MoE)

2026年4月发布,Apache 2.0,知识蒸馏极致,同参数级越级打怪

中等

Apache 2.0

Gemma 3

Google

2B~27B

轻量级模型中的佼佼者,单卡友好

中等

Gemma Terms

Phi-4

Microsoft

5B~14B

MIT 协议,小参数大能力,边缘设备首选

良好

MIT

Kimi K2.6

月之暗面

MoE (未公开)

超长上下文编码,多智能体编排,代码生成能力强

极佳

自定义

2026年推荐模型速览


2 从零开始部署大模型

2.1 基础篇:Ollama 一键部署(新手首选)

Ollama 是什么?

简单说,Ollama 就是一个"大模型界的 Docker"——它把复杂的模型下载、环境配置、依赖管理全部打包好,让你用一条命令就能跑起大模型。底层基于 llama.cpp,支持 Windows / macOS / Linux 全平台。

2.1.1 安装 Ollama

Windows 安装

① 访问 ollama.com/download 下载 OllamaSetup.exe

② 双击安装,一路下一步即可

③ 安装完成后,打开 PowerShell 或 命令提示符,输入:ollama --version

看到版本号(如 ollama version 0.6.x)说明安装成功。

macOS 安装

# 方式一:Homebrew(推荐)

brew install ollama

 

# 方式二:官网下载 .dmg 安装包

# 访问 https://ollama.com/download 下载后双击安装

Linux 安装

# 一行命令安装

curl -fsSL https://ollama.com/install.sh | sh

 

# 验证安装

ollama --version

2.1.2 下载并运行你的第一个模型

# 下载并运行 Qwen3 0.6B 模型

ollama run qwen3:0.6b-q4_K_M

 

# 或者使用 Llama 3.1 8B(英文场景)

ollama run llama3.1:8b

 

# 使用 DeepSeek-R1 7B(推理能力强)

ollama run deepseek-r1:7b

第一次运行会自动下载模型(约 4-5GB),下载完成后直接进入对话界面,你就可以和模型聊天了!

2.1.3 Ollama 常用命令

# 查看已安装的模型列表

ollama list

 

# 查看模型详细信息(大小、量化精度、参数等)

ollama show qwen3:0.6b

 

# 仅下载模型(不启动对话)

ollama pull qwen3:0.6b

 

# 删除模型

ollama rm qwen3:0.6b

 

# 使用指定量化版本(推荐 Q4_K_M,最平衡的选择)

ollama run qwen3:0.6b-q4_K_M

 

# 查看当前运行状态

ollama ps

 

# 停止运行中的模型

ollama stop qwen3:0.6b

2.1.4 通过 API 调用 Ollama(Python 示例)

Ollama 的 API 与 OpenAI 格式兼容,改个 base_url 就能用:

from openai import OpenAI

 

# 连接到本地 Ollama 服务(默认端口 11434)

client = OpenAI(

    base_url="http://localhost:11434/v1",

    api_key="ollama"  # 本地服务随便填,不会校验

)

 

# 发起对话

response = client.chat.completions.create(

    model="qwen3:7b",

    messages=[

        {"role": "system", "content": "你是一个乐于助人的AI助手。"},

        {"role": "user", "content": "请用一句话解释什么是机器学习。"}

    ],

    temperature=0.7,

    max_tokens=500

)

 

print(response.choices[0].message.content)

2.1.5 自定义模型配置(Modelfile)

如果需要调整模型参数(如上下文长度、温度等),可以创建 Modelfile:

# 文件名:Modelfile

FROM qwen3:7b

 

# 设置上下文长度(默认只有 2048,建议调大)

PARAMETER num_ctx 8192

 

# 设置温度(0-1,越低越确定,越高越有创意)

PARAMETER temperature 0.7

 

# 设置系统提示词

SYSTEM """你是一个专业的Python编程助手,回答问题时请使用中文,并给出代码示例。"""



# 构建自定义模型

ollama create my-qwen -f Modelfile

 

# 运行自定义模型

ollama run my-qwen

2.2 进阶篇:vLLM 高性能部署

vLLM 是什么?

vLLM 是伯克利大学开源的生产级推理引擎,专为高并发、高吞吐场景设计。它使用 PagedAttention 技术,显存利用率比传统方案提升 95%,多用户并发时吞吐量是 Ollama 的 5-20 倍

前置要求:vLLM 需要 NVIDIA GPU(计算能力 7.0+,即 GTX 10 系列以上)、Linux 系统、Python 3.9-3.12、CUDA 11.8+。Windows 用户建议使用 WSL2 或 Docker

2.2.1 安装 vLLM

# 1. 安装wsl。安装完后重启电脑

wsl --install

 

# 2. 启动wsl,按照上一个教程安装好anaconda后,创建新的 Python 虚拟环境

wsl

conda create -n vllm python=3.11 -y

conda activate vllm

 

# 3. 安装 vLLM(自动安装 PyTorch + CUDA 依赖)

pip install vllm

 

# 4. 验证安装

python -c "import vllm; print(vllm.__version__)"

2.2.2 下载模型,启动 OpenAI 兼容 API 服务器

git clone https://www.modelscope.cn/cyankiwi/Qwen3.5-9B-AWQ-4bit.git

使用git命令下载模型

# 启动 vLLM API 服务(单 GPU)

CUDA_VISIBLE_DEVICES=1 VLLM_USE_FLASHINFER_SAMPLER=0 \

python -m vllm.entrypoints.openai.api_server \

    --model /mnt/e/models/Qwen3.5-9B-AWQ-4bit \

    --host 0.0.0.0 \

    --port 8000 \

    --max-model-len 4096 \

    --gpu-memory-utilization 0.7 \

    --dtype auto

    --enable-auto-tool-choice

    --tool-call-parser qwen3_coder

    --tensor-parallel-size 1

参数说明

CUDA_VISIBLE_DEVICES=1:使用第二块显卡,博主这里用两张显卡

VLLM_USE_FLASHINFER_SAMPLER=0:禁用FlashInfer 采样器,由于博主采用不稳定所以采用torch原生的采样器

参数

含义

建议值

--model

模型名称(HuggingFace 路径或本地路径)

按需选择

--host

监听地址

0.0.0.0(允许外部访问)

--port

监听端口

8000

--max-model-len

最大上下文长度

4096-8192(越长越吃显存)

--gpu-memory-utilization

GPU 显存使用比例

0.85-0.90(不要设 0.95,容易 OOM)

--dtype

数据类型

auto(自动选择最优)

--tensor-parallel-size

多卡并行数

有多少张 GPU 就设多少

--enable-auto-tool-choice

是否启用工具

与tool-call-parser配合使用

2.2.3 调用 vLLM API(Python 示例)

from openai import OpenAI

 

# vLLM 的 API 也是 OpenAI 兼容的

client = OpenAI(

    base_url="http://localhost:8000/v1",

    api_key="not-needed"  # 本地服务不需要

)

 

response = client.chat.completions.create(

    model="/mnt/e/models/Qwen3.5-9B-AWQ-4bit",

    messages=[

        {"role": "user", "content": "你好,请介绍一下你自己。"}

    ],

    max_tokens=200

)

 

print(response.choices[0].message.content)

也可以用 curl 测试:

curl http://localhost:8000/v1/chat/completions \

  -H "Content-Type: application/json" \

  -d '{

    "model": "/mnt/e/models/Qwen3.5-9B-AWQ-4bit",

    "messages": [{"role": "user", "content": "你好"}],

    "max_tokens": 100

  }'

2.2.4 多 GPU 并行(Tensor Parallelism)

如果你有多张 GPU,vLLM 可以自动拆分模型到多张卡上:

# 使用 2 张 GPU 并行推理

python -m vllm.entrypoints.openai.api_server \

    --model Qwen/Qwen3-70B-Instruct-AWQ \

    --tensor-parallel-size 2 \

    --gpu-memory-utilization 0.90

2.3 Ollama vs vLLM:深度对比分析

一张表看懂全部差异

对比维度

Ollama

vLLM

核心定位

桌面端本地 AI 工具

生产级推理服务器

安装难度

一行命令,5 分钟搞定

需配置 Python 环境、CUDA,约 15-30 分钟

上手门槛

极低,会用命令行就能玩

中等,需要了解 Python 和 Linux 基础

操作系统

Windows / macOS / Linux 全支持

仅 Linux(Windows 需 WSL2/Docker)

硬件要求

无 GPU 也能跑(CPU 模式),支持 Apple Silicon

需要 NVIDIA GPU(计算能力 7.0+),16GB 显存起步

单用户速度

优秀(7B 模型约 80-120 tok/s)

良好(7B 模型约 90-140 tok/s)

多用户并发

弱(4-8 并发即排队,16 并发崩溃)

强(256+ 并发稳定,吞吐量是 Ollama 的 5-20 倍)

显存效率

良好(静态分配)

优秀(PagedAttention,利用率提升 95%)

多 GPU 支持

有限

原生支持张量并行 + 流水线并行

量化格式

GGUF(Q4_K_M 等)

AWQ, GPTQ, FP8, INT8, GGUF

API 兼容性

自有 API + OpenAI 兼容

完整 OpenAI 兼容

模型管理

自动下载、版本管理,超方便

手动管理(需自己下载 HuggingFace 模型)

上下文管理

动态上下文缩放(自动适配显存)

需手动指定 --max-model-len

社区生态

丰富的 GUI 工具(Open WebUI、LM Studio 等)

偏开发者工具,需自行搭建前端

性能实测数据(RTX 4090 24GB,Qwen2.5-7B)

测试场景

Ollama

vLLM

胜出

单用户,2K 上下文

78 tok/s

145 tok/s

vLLM(快 86%)

4 并发请求

排队执行,总耗时 4x

并行处理,总耗时 1.2x

vLLM(快 3.3 倍)

16 并发请求

崩溃

610 tok/s 总吞吐

vLLM(碾压)

显存占用(7B Q4)

7.2 GB

8.8 GB(含 KV Cache)

Ollama(略省)

显存占用(70B Q4)

21.5 GB

10.7 GB

vLLM(省 50%)

决策建议:什么时候用哪个?

选 Ollama 的情况

•  你是新手,想快速体验本地大模型

•  只有一台电脑,用于个人日常使用

•  需要 Windows / macOS 支持

•  经常切换不同模型做实验

•  不需要高并发(同时只有你一个人用)

选 vLLM 的情况

•  需要为团队或公司提供 API 服务(多用户同时访问)

•  有多张 GPU 需要充分利用

•  要求极致的吞吐量和低延迟

•  已有 Linux 服务器,愿意投入配置时间

•  对显存效率有极致追求(同等硬件跑更大模型)

一句话总结个人玩用 Ollama,生产部署用 vLLM。


3  总结与常见问题

3.1 总结:我该选哪个?

你的需求

推荐方案

就想试试,能聊就行

Ollama + qwen3:7b

开发者日常写代码用

Ollama + deepseek-coder-v2:16b

给团队搭 API 服务

vLLM + Qwen3-32B-AWQ

多张显卡想跑大模型

vLLM + tensor-parallel

MacBook(无 NVIDIA 卡)

Ollama(Metal 加速)

8GB 内存老笔记本

Ollama + qwen3:4b

核心要点回顾

1.  显存决定一切:你能跑什么模型,取决于显存大小,而非 CPU 性能

2.  INT4 量化是新手最佳选择:4-6GB 显存就能跑 7B 模型,质量损失不到 5%

3.  Ollama = 简单,vLLM = 强大:从 Ollama 入门,有需要再上 vLLM

4.  中文用户首选 Qwen3 和 DeepSeek:中文能力最强,社区生态最完善

5.  本地部署不是零成本:需要一次性硬件投入,但长期高频使用比云端 API 便宜得多

3.2 常见问题与解决方案

Q1:运行时提示 "model requires more system memory"(显存不足)

原因:模型太大,显存放不下。

解决

1.  换更小的量化版本:ollama run qwen3:7b-instruct-q4_K_M(不要用默认版本)

2.  换更小的模型:7B 不行就换 4B,4B 不行就换 1.5B

3.  限制上下文长度:ollama run qwen3:7b --num-ctx 2048

4.  关闭其他占用显存的程序(浏览器、游戏等)

Q2:Ollama 没有调用 GPU,一直在用 CPU 跑(速度极慢)

原因:GPU 未被正确识别,通常是因为 NVIDIA 驱动问题。

解决

# 1. 先确认系统能识别 GPU

nvidia-smi

 

# 2. 如果 nvidia-smi 报错,说明驱动有问题,重新安装 NVIDIA 驱动

# 访问 https://www.nvidia.com/drivers 下载最新驱动

 

# 3. Linux 下可以尝试强制加载驱动

sudo nvidia-modprobe -u

sudo rmmod nvidia_uvm && sudo modprobe nvidia_uvm

 

# 4. Windows 下检查 Ollama 日志

# 按 Win+R,输入:%LOCALAPPDATA%\Ollama\server.log

Q3:模型回答质量很差,胡言乱语

可能原因

1.  用了错误的量化精度:默认的 Q4_K_M 质量不错,如果用了更低的 Q2_K 可能质量下降明显

2.  Prompt 模板不对:确保使用 Instruct 版本(如 qwen3:7b-instruct-q4_K_M),而非 Base 版本

3.  上下文长度太短:默认只有 2048,长对话会被截断。修改 Modelfile 调大 num_ctx

# 使用 Instruct 版本(有指令微调)

ollama run qwen3:7b-instruct-q4_K_M

 

# 而非 Base 版本(没有指令微调,不适合对话)

# ollama run qwen3:7b  # ❌ 不推荐

Q4:vLLM 安装失败,提示 CUDA 版本不兼容

解决

# 1. 确认 CUDA 版本

nvcc --version

nvidia-smi  # 查看右上角 CUDA Version

 

# 2. 创建干净的 conda 环境重新安装

conda create -n vllm python=3.11 -y

conda activate vllm

 

# 3. 安装指定 CUDA 版本的 vLLM

pip install vllm  # 默认 CUDA 12.1

 

# 如果是 CUDA 11.8

pip install vllm --extra-index-url https://download.pytorch.org/whl/cu118

Q5:vLLM 启动后显存占用过高,报 OOM

解决

1.  降低 --gpu-memory-utilization:从 0.90 降到 0.85 甚至 0.80

2.  缩短 --max-model-len:从 8192 降到 4096

3.  使用量化版本:--quantization awq

4.  减少 --max-num-seqs:默认 256,可降到 32

python -m vllm.entrypoints.openai.api_server \

    --model Qwen/Qwen3-7B-Instruct-AWQ \

    --quantization awq \

    --gpu-memory-utilization 0.80 \

    --max-model-len 4096 \

    --max-num-seqs 32

Q6:Ollama 服务无法启动,提示端口被占用

解决

# Windows:查看端口占用

netstat -ano | findstr :11434

 

# Linux/macOS:查看端口占用

lsof -i :11434

 

# 杀死占用进程后重新启动

# 或者直接重启 Ollama 服务

# Linux

sudo systemctl restart ollama

 

# macOS

pkill ollama && ollama serve

Q7:API 调用报 "Connection Refused"

原因:Ollama 服务没有在后台运行。

解决

# 手动启动 Ollama 服务

ollama serve

 

# 或者在另一个终端窗口运行模型时,Ollama 会自动启动服务

Q8:Windows 下 PowerShell 无法识别 `ollama` 命令

解决

1.  关闭所有终端窗口,重新打开(PATH 不会自动刷新)

2.  如果还不行,手动添加环境变量:%LOCALAPPDATA%\Programs\Ollama

3.  或者直接使用完整路径:%LOCALAPPDATA%\Programs\Ollama\ollama.exe

Q9:模型回复到一半就停了

原因

1.  max_tokens 设置太小

2.  上下文长度不足,被截断

解决

# API 调用时设置更大的 max_tokens

response = client.chat.completions.create(

    model="qwen3:7b",

    messages=[...],

    max_tokens=4096  # 增大这个值

)

 

# 或在 Modelfile 中设置

# PARAMETER num_predict 4096



3.3 推荐学习路径

第一步:安装 Ollama,跑通第一个模型(本文 2.1 节)

    ↓

第二步:熟悉 Ollama 常用命令和 API 调用

    ↓

第三步:尝试不同模型,找到最适合你场景的那个

    ↓

第四步:学习 Modelfile,自定义模型参数

    ↓

第五步:搭建 Open WebUI 图形界面,获得类 ChatGPT 体验

    ↓

第六步(可选):学习 vLLM,搭建生产级 API 服务

    ↓

第七步(可选):学习 RAG(检索增强生成),构建私有知识库

推荐配套工具

工具

用途

链接

Open WebUI

为 Ollama/vLLM 提供 ChatGPT 风格的 Web 界面

[github.com/open-webui/open-webui](https://github.com/open-webui/open-webui)

LM Studio

图形化本地模型管理工具(适合不喜欢命令行的用户)

[lmstudio.ai](https://lmstudio.ai)

Continue

VS Code / JetBrains IDE 插件,用本地模型做代码补全

[continue.dev](https://continue.dev)

LiteLLM

统一 API 网关,管理多个模型服务

[github.com/BerriAI/litellm](https://github.com/BerriAI/litellm)

LangChain

构建 LLM 应用的主流框架,支持 Ollama 和 vLLM

[langchain.com](https://langchain.com)


其实本地部署大模型,远没有想象中复杂 —— 不用啃厚厚的技术文档,不用精通编程,从安装 Ollama 开始,下载一个轻量模型,十几分钟就能体验到本地 AI 的流畅感。

我们不用追求一步到位:先跑通基础版本,感受本地部署的优势;再根据自己的需求,慢慢尝试自定义配置、切换模型,甚至进阶到 vLLM 的高性能部署。

无论是想保护数据隐私,还是想降低使用成本,亦或是单纯想探索 AI 的底层逻辑,本地部署都是值得一试的方向。你的电脑算力,不该只用来刷视频、打游戏 —— 把大模型装进去,让它成为你的专属助手,才是真正发挥了它的价值。

现在就动手试试吧,从第一条ollama run命令开始,开启你的本地大模型之旅。

更多推荐