• 首推使用ollama

Ollama是啥

一个开源工具,可在本地快速部署和运行大型语言模型(LLM)。

  • 优点:
    • 不依赖云端服务,保护数据隐私,降低使用成本
    • 兼容 OpenAI API 生态
    • 跨平台 - 支持 Windows、macOS、Linux
    • 模型管理 - 内置模型下载和管理命令

Ollama常用命令

  • 启动服务, 需要先启动服务才能进行其他操作
ollama serve
  • 拉取模型,只把模型文件拉到本地
ollama pull <模型名>
  • 查看已安装模型
# ollama list
NAME                       ID              SIZE      MODIFIED
qwen2.5:1.5b               65ec06548149    986 MB    5 days ago
nomic-embed-text:latest    0a109f422b47    274 MB    4 weeks ago
qwen2.5-coder:7b           dae161e27b0e    4.7 GB    5 weeks ago
  • 查看模型详细信息,qwen2.5:1.5b是模型名
# ollama show qwen2.5:1.5b
  Model
    architecture        qwen2
    parameters          1.5B
    context length      32768
    embedding length    1536
    quantization        Q4_K_M

  Capabilities
    completion
    tools

  System
    You are Qwen, created by Alibaba Cloud. You are a helpful assistant.

  License
    Apache License
    Version 2.0, January 2004
    ...
  • 交互对话模式 , 如果本地没有该模型,会先拉取到本地再运行
ollama run <模型名>
  • 查看正在运行的模型
 ollama ps
NAME                ID              SIZE      PROCESSOR    CONTEXT    UNTIL
qwen2.5-coder:7b    dae161e27b0e    4.6 GB    100% CPU     4096       About a minute from now

模型路径

  • 默认路径

~/.ollama/models

C:\Users\<用户名>\.ollama\models

  • 自定义模型路径:

使用环境变量 OLLAMA_HOME

export OLLAMA_HOME=/path/to/new/models

set OLLAMA_HOME=C:\path\to\new\models

API访问

  • Ollama 会监听本地主机的 http://localhost:11434 端口
  • JSON格式的请求和响应

自定义API端口

可以修改环境变量,例如:

export OLLAMA_HOST=0.0.0.0
export OLLAMA_PORT=8080

测试ollama API的响应

  • 使用curl 命令
curl -X GET http://localhost:11434/api/tags
  • 其他测试工具,例如potman

注意代理:

有的网络环境需要代理访问网络,如果遇到问题,要设置本机地址访问不要过代理
 

export no_proxy="localhost,127.0.0.1"
export NO_PROXY="localhost,127.0.0.1"

聊天助手的实现

Gradio框架

Python Web UI 框架,快速构建机器学习模型演示界面:

  • 快速开发 - 几行代码创建 Web 界面
  • 美观界面 - 内置多种主题和组件
  • 响应式设计 - 自动适配不同设备
  • 实时交互 - 支持流式输出
     


 

更多推荐