阿里最强开源大模型Qwen2-7B：本地部署、API调用、WebUI对话机器人，一篇文章全掌握！

阿里巴巴发布Qwen2系列开源大模型，包含5个不同尺寸版本，其中Qwen2-72B在多项评测中超越Llama3-70B等主流模型。文章重点演示了Qwen2-7B-Instruct的中等规模模型部署过程，包括GGUF文件下载、Python依赖安装、服务端启动及命令行客户端搭建。该模型在代码和中文理解方面表现优异，除72B版本沿用Qianwen协议外，其余均采用Apache 2.0许可。最后还介绍了W

python零基础入门小白

721人浏览 · 2025-08-25 18:04:33

python零基础入门小白 · 2025-08-25 18:04:33 发布

阿里巴巴通义千问团队发布了Qwen2系列开源模型，该系列模型包括5个尺寸的预训练和指令微调模型：Qwen2-0.5B、Qwen2-1.5B、Qwen2-7B、Qwen2-57B-A14B以及Qwen2-72B。对比当前最优的开源模型，Qwen2-72B在包括自然语言理解、知识、代码、数学及多语言等多项能力上均显著超越当前领先的Llama3-70B等大模型。

Qwen2-72B模型评测

老牛同学今天部署和体验Qwen2-7B-Instruct指令微调的中等尺寸模型，相比近期推出同等规模的开源最好的Llama3-8B、GLM4-9B等模型，Qwen2-7B-Instruct依然能在多个评测上取得显著的优势，尤其是代码及中文理解上。

在这里插入图片描述

Qwen2-7B模型

特别注意： 虽然Qwen2开源了，但仍然需要遵循其模型许可，除Qwen2-72B依旧使用此前的Qianwen License外，其余系列版本模型，包括Qwen2-0.5B、Qwen2-1.5B、Qwen2-7B以及Qwen2-57B-A14B等在内，均采用Apache 2.0许可协议。

下载Qwen2-7B-instruct模型文件

为了简化模型的部署过程，我们直接下载GGUF文件。

打开Qwen2-7B-Instruct-GGUF模型文件列表，我们选择qwen2-7b-instruct-q5_k_m.gguf并下载：

Qwen2-7B量化模型文件

我们可以根据自己需要，选择下载其它版本的模型文件！

启动Qwen2-7B-Instruct大模型

GGUF模型量化文件下载完成后，我们就可以来运行Qwen2-7B大模型了。

在启动Qwen2-7B大模型之前，我们首先需要安装Python依赖包列表：

pip install llama-cpp-python   pip install openai   pip install uvicorn   pip install starlette   pip install fastapi   pip install sse_starlette   pip install starlette_context   pip install pydantic_settings

然后打开一个Terminal终端窗口，切换到GGUF模型文件目录，启动Qwen2-7B大模型（./qwen2-7b-instruct-q5_k_m.gguf即为上一步下载的模型文件路径）：

# 启动Qwen2大模型      # n_ctx=20480代表单次回话最大20480个Token数量   python -m llama_cpp.server \      --host 0.0.0.0 \      --model ./qwen2-7b-instruct-q5_k_m.gguf \      --n_ctx 20480

Qwen2-7B启动成功

Qwen2-7B-instruct 命令行对话客户端

CLI命令行的客户端

# client.py      from openai import OpenAI      # 注意服务端端口，因为是本地，所以不需要api_key   client = OpenAI(base_url="http://127.0.0.1:8000/v1",                   api_key="not-needed")      # 对话历史：设定系统角色是一个只能助理，同时提交“自我介绍”问题   history = [       {"role": "system", "content": "你是一个智能助理，你的回答总是容易理解的、正确的、有用的和内容非常精简."},   ]      # 首次自我介绍完毕，接下来是等代码我们的提示   while True:       completion = client.chat.completions.create(           model="local-model",           messages=history,           temperature=0.7,           stream=True,       )          new_message = {"role": "assistant", "content": ""}          for chunk in completion:           if chunk.choices[0].delta.content:               print(chunk.choices[0].delta.content, end="", flush=True)               new_message["content"] += chunk.choices[0].delta.content          history.append(new_message)       print("\033[91;1m")          user_input = input("> ")       if user_input.lower() in ["bye", "quit", "exit"]:  # 我们输入bye/quit/exit等均退出客户端           print("\033[0mBYE BYE!")           break          history.append({"role": "user", "content": user_input})       print("\033[92;1m")

启动CLI对话客户端：python client.py

Qwen2-7B启动成功

至此，我们可以与Qwen2-7B-Instruct进行对话，体验Qwen2大模型的魅力了。

如果我们主要是通过API的方式使用Qwen2大模型，那么Qwen2部署就到此结束了。

接下来的章节，我们部署WebUI对话客户端，通过Web界面的方式使用Qwen2大模型，并且可以分享出去~

Qwen2-7B-Instruct WebUI客户端

结合Ollama工具，搭建WebUI客户端

第一步： 我们需要下载安装Ollama本地大模型管理工具：

Ollama提供了MacOS、Linux和Windows操作系统的安装包，大家可根据自己的操作系统，下载安装即可：

Ollama下载

安装包下载之后的安装过程，和日常安装其他软件没有差别，包括点击Next以及Install等安装ollama到命令行。安装后续步骤中，我们可无需安装任何模型，因为我们在上文中我们已经安装了Qwen2-7B大模型，后面可以直接使用。

第二步： 安装Node.js编程语言工具包

安装Node.js编程语言工具包和安装其他软件包一样，下载安装即可：https://nodejs.org

Node.js下载

安装完成之后，可以验证一下 Node.js 的版本，建议用目前的最新v20版本：

node -v

老牛同学安装的版本：v20.13.1（最新版本）

第三步： 基于GGUF模型文件创建Ollama模型

在我们存放Qwen2-7B的 GGUF 模型文件目录中，创建一个文件名为Modelfile的文件，该文件的内容如下：

FROM ./qwen2-7b-instruct-q5_k_m.gguf

然后在Terminal终端，使用这个文件创建Ollama模型，这里我把Ollama的模型取名为Qwen2-7B：

$ ollama create Qwen2-7B -f ./Modelfile   transferring model data    using existing layer sha256:258dd2fa1bdf98b85327774e1fd36e2268c2a4b68eb9021d71106449ee4ba9d5    creating new layer sha256:14f4474ef69698bf4dbbc7409828341fbd85923319a801035e651d9fe6a9e9c9    writing manifest    success

最后，通过Ollama启动我们刚创建的大语言模型：

ollama run Qwen2-7B

启动完毕，其实我们已经有了一个和之前差不多的控制台对话界面，也可以与Qwen2-7B对话了。

Ollama启动模型

如果我们不想要这个模型了，也可以通过命令行删除模型文件：ollama rm Qwen2-7B

我们也可以查看本地Ollama管理的模型列表：ollama list

Ollama存放模型文件根目录：~/.ollama

第四步： 部署Ollama大模型Web对话界面

控制台聊天对话界面体验总归是不太好，接下来部署 Web 可视化聊天界面。

首先，下载ollama-webuiWeb 工程代码：git clone https://github.com/ollama-webui/ollama-webui-lite

然后切换ollama-webui代码的目录：cd ollama-webui-lite

设置 Node.js 工具包镜像源，以接下来下载 Node.js 的依赖包更加快速：npm config set registry http://mirrors.cloud.tencent.com/npm/

安装 Node.js 依赖的工具包：npm install

最后，启动 Web 可视化界面：npm run dev

WebUI启动成功

如果看到以上输出，代表 Web 可视化界面已经成功了！

第五步： 通过WebUI愉快与Qwen2-7B对话

浏览器打开 Web 可视化界面：http://localhost:3000/

可以看到Ollama的初始化页面，默认没有模型，需要选择，我们选择刚创建并部署的Qwen2-7B模型：

选择Qwen2-7B大模型

底部就是聊天输入框，至此可以愉快的与Qwen2-7B聊天对话了：

总结：Qwen2-7B比Llama3-8B快

老牛同学验证和对比，在文本推理上，Qwen2-7B确实比Llama3-8B要快很多。后续老牛同学中文文本推理相关的API接口，就主要采用更快Qwen2-7B大模型了~

其他：`Ollama`工具常用用法

从上文的介绍可以看到，基于Ollama部署一个大模型的 Web 可视化对话机器人，还是非常方便。下面整理了部分Ollama提供的用法或者。

Ollama 命令工具

# 查看当前Ollama的模型   ollama list      # 增量更新当前部署的模型   ollama pull Qwen2-7B      # 删除一个模型文件   ollama rm Qwen2-7B      # 复制一个模型   ollama cp Qwen2-7B Qwen2-newModel

Ollama API结果返回

curl http://localhost:11434/api/generate -d '{     "model": "Qwen2-7B",     "prompt":"为什么天空是蓝色的？"   }'

Ollama API聊天对话

curl http://localhost:11434/api/chat -d '{     "model": "Qwen2-7B",     "messages": [       { "role": "user", "content": "为什么天空是蓝色的？" }     ]   }'

如何学习AI大模型？

我在一线互联网企业工作十余年里，指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家，也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑，所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限，很多互联网行业朋友无法获得正确的资料得到学习提升，故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

这份完整版的大模型 AI 学习和面试资料已经上传CSDN，朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

在这里插入图片描述

第一阶段： 从大模型系统设计入手，讲解大模型的主要方法；

第二阶段： 在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用；

第三阶段： 大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统；

第四阶段： 大模型知识库应用开发以LangChain框架为例，构建物流行业咨询智能问答系统；

第五阶段： 大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型；

第六阶段： 以SD多模态大模型为主，搭建了文生图小程序案例；

第七阶段： 以大模型平台应用与开发为主，通过星火大模型，文心大模型等成熟大模型构建大模型行业应用。

在这里插入图片描述

👉学会后的收获：👈

• 基于大模型全栈工程实现（前端、后端、产品经理、设计、数据分析等），通过这门课可获得不同能力；

• 能够利用大模型解决相关实际项目需求：大数据时代，越来越多的企业和机构需要处理海量数据，利用大模型技术可以更好地处理这些数据，提高数据分析和决策的准确性。因此，掌握大模型应用开发技能，可以让程序员更好地应对实际项目需求；

• 基于大模型和企业数据AI应用开发，实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能，学会Fine-tuning垂直训练大模型（数据准备、数据蒸馏、大模型部署）一站式掌握；

• 能够完成时下热门大模型垂直领域模型训练能力，提高程序员的编码能力：大模型应用开发需要掌握机器学习算法、深度学习框架等技术，这些技术的掌握可以提高程序员的编码能力和分析能力，让程序员更加熟练地编写高质量的代码。

在这里插入图片描述

1.AI大模型学习路线图
2.100套AI大模型商业化落地方案
3.100集大模型视频教程
4.200本大模型PDF书籍
5.LLM面试题合集
6.AI产品经理资源合集

👉获取方式：
😝有需要的小伙伴，可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓

在这里插入图片描述

杭州城市开发者社区

纵情码海钱塘涌，杭州开发者创新动！属于杭州的开发者社区！致力于为杭州地区的开发者提供学习、合作和成长的机会；同时也为企业交流招聘提供舞台！

更多推荐

金仓人才计划：以实战锻造数据库精英，助力国产数据库生态发展

杭州城市开发者社区

创新型调制方案——剪枝DFT扩展FBMC结合SC-FDMA优势研究（Matlab代码实现）

本文提出一种新型调制方案，将滤波器组多载波（FBMC）-偏移正交幅度调制与单载波频分多址（SC-FDMA）的优势相结合。在传统FBMC系统基础上，开发基于“剪枝离散傅里叶变换（DFT）”并结合单抽头尺度缩放的新型预编码方法。该技术具备与SC-FDMA相同的峰均功率比（PAPR），无需循环前缀，带外辐射显著降低，恢复复数域正交性，大幅缩短FBMC的上升/下降周期以支持低时延传输，与纯SC-FDMA相

杭州城市开发者社区

拼团项目2-14：回调通知任务

在微服务设计中，当一个微服务系统的流程结束后，要通知下一个微服务系统。这个通知的过程，可以是 RPC、MQ，也可以是 HTTP 方式。RPC、MQ，这一类的都是需要有一个公用的注册中心，它的技术架构。如果是有。那么，本章节要为拼团组队交易结算完结后，实现一个回调通知的任务处理。告知另外的微服务系统可以进行后续的流程了。注意：微信支付，支付宝支付，也是在完成支付后，做的这样的回调处理。结算完成后，进