大模型本地部署
·
- 首推使用ollama
Ollama是啥
一个开源工具,可在本地快速部署和运行大型语言模型(LLM)。
- 优点:
- 不依赖云端服务,保护数据隐私,降低使用成本
- 兼容 OpenAI API 生态
- 跨平台 - 支持 Windows、macOS、Linux
- 模型管理 - 内置模型下载和管理命令
Ollama常用命令
- 启动服务, 需要先启动服务才能进行其他操作
ollama serve
- 拉取模型,只把模型文件拉到本地
ollama pull <模型名>
- 查看已安装模型
# ollama list
NAME ID SIZE MODIFIED
qwen2.5:1.5b 65ec06548149 986 MB 5 days ago
nomic-embed-text:latest 0a109f422b47 274 MB 4 weeks ago
qwen2.5-coder:7b dae161e27b0e 4.7 GB 5 weeks ago
- 查看模型详细信息,qwen2.5:1.5b是模型名
# ollama show qwen2.5:1.5b
Model
architecture qwen2
parameters 1.5B
context length 32768
embedding length 1536
quantization Q4_K_M
Capabilities
completion
tools
System
You are Qwen, created by Alibaba Cloud. You are a helpful assistant.
License
Apache License
Version 2.0, January 2004
...
- 交互对话模式 , 如果本地没有该模型,会先拉取到本地再运行
ollama run <模型名>
- 查看正在运行的模型
ollama ps
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen2.5-coder:7b dae161e27b0e 4.6 GB 100% CPU 4096 About a minute from now
模型路径
- 默认路径
~/.ollama/models
C:\Users\<用户名>\.ollama\models
- 自定义模型路径:
使用环境变量 OLLAMA_HOME
export OLLAMA_HOME=/path/to/new/models
set OLLAMA_HOME=C:\path\to\new\models
API访问
- Ollama 会监听本地主机的
http://localhost:11434端口 - JSON格式的请求和响应
自定义API端口
可以修改环境变量,例如:
export OLLAMA_HOST=0.0.0.0
export OLLAMA_PORT=8080
测试ollama API的响应
- 使用curl 命令
curl -X GET http://localhost:11434/api/tags
- 其他测试工具,例如potman
注意代理:
有的网络环境需要代理访问网络,如果遇到问题,要设置本机地址访问不要过代理
export no_proxy="localhost,127.0.0.1"
export NO_PROXY="localhost,127.0.0.1"
聊天助手的实现
Gradio框架
Python Web UI 框架,快速构建机器学习模型演示界面:
- 快速开发 - 几行代码创建 Web 界面
- 美观界面 - 内置多种主题和组件
- 响应式设计 - 自动适配不同设备
- 实时交互 - 支持流式输出
更多推荐


所有评论(0)