Ollama快速使用指南
Ollama简介
Ollama 由美国初创公司Ollama, Inc.开发,专为在本地机器上便捷部署和运行大型语言模型(LLM)而设计。支持从官方模型库或自定义模型库拉取预训练模型,并在本地保存和加载。下面将介绍如何在Linux操作系统上安装和使用 Ollama。
一 Ollama安装
1. 安装桌面软件可以去官网下载:Ollama官网

在 Linux 上,可以通过以下命令进行安装:
curl -fsSL https://ollama.com/install.sh | sh
如果下载缓慢,可在网上搜寻国内镜像资源。
2. 官方支持的模型
点击官网Models菜单栏,即可看到官方支持的模型:

二 常用ollama命令
1. 查看帮助信息
要查看 Ollama 支持的所有命令及其用法,可以使用以下命令:

2. 拉取模型
要拉取某个模型到本地进行推理,使用 pull 命令。例如,拉取一个名为 deepseek-r1 的模型:

设置模型参数,通过JSON文件定义推理参数,例如设置max_tokens、temperature等。
{
"model": "deepseek-r1:1.5b",
"parameters": {
"temperature": 0.7,
"top_p": 0.9,
"max_tokens": 2048
},
"system_message": "你是一个专业的AI助手"
}
3. 运行模型
运行 deepseek-r1模型并输入一句话让其进行推理:

4. 支持Http接口调用
Ollama 还提供了 HTTP 接口,允许用户通过 REST API 调用模型进行推理。
1)启动 HTTP 服务
首先,需要启动 Ollama 的 HTTP 服务,ollama serve命令启动服务,默认情况下监听 localhost:11434。你可以通过浏览器或 Postman 访问 API 进行测试。
2)发起 HTTP 请求
使用 curl 命令发起 HTTP 请求,调用deepseek-r1 模型进行推理:
curl -X POST http://localhost:11434/api/generate \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-r1:1.5b",
"prompt": "你是谁",
"max_length": 50,
"stream": false
}'
该请求将返回模型生成的文本。响应格式为 JSON,如下:
{"model":"deepseek-r1:1.5b","created_at":"2025-09-23T03:48:00.21186896Z","response":"\u003cthink\u003e\n\n\u003c/think\u003e\n\n您好!我是由中国的深度求索(DeepSeek)公司开发的智能助手DeepSe
ek-R1。如您有任何任何问题,我会尽我所能为您提供帮助。","done":true,"done_reason":"stop","context":[151644,105043,100165,151645,151648,271,151649,271,111308,6313,104198,67071,105538,102217,30
918,50984,9909,33464,39350,7552,73218,100013,9370,100168,110498,33464,39350,10911,16,1773,29524,87026,110117,99885,86119,3837,105351,99739,35946,111079,113445,100364,1773],"total_duration":1
547328639,"load_duration":16374632,"prompt_eval_count":5,"prompt_eval_duration":100204134,"eval_count":40,"eval_duration":1430239843}
5. 通过环境变量调优Ollama并发性
Ollama 支持通过设置环境变量来优化并发处理和性能。可以使用更多 Worker 实例处理请求,提升 API 的吞吐量;使用多线程加速推理,充分利用 CPU 资源;缓存模型结果,减少重复计算;保持连接,减少网络延迟。
export OLLAMA_MAX_WORKERS=8
export OLLAMA_NUM_THREADS=16
export OLLAMA_CACHE_SIZE=8GB
export OLLAMA_KEEP_ALIVE_TIMEOUT=60s
6. 日志
Ollama 提供详细的日志功能,帮助开发者进行调试和性能监控。
三 总结
Ollama是一个功能强大的本地化大模型推理平台,其核心优势体现在三个方面:
- 支持多模式访问,用户可通过命令行、HTTP API及OpenAI客户端灵活调用模型;
- 高度可配置性,通过环境变量可自由调整设备选择(GPU/CPU)、并发数、日志等级等参数,适配不同计算环境;
- 应用场景广泛,凭借本地化部署特性,在隐私保护需求强烈的场景和需要高性能计算的规模化推理任务中均表现优异,提供安全高效的AI推理解决方案。
更多推荐



所有评论(0)