登录社区云,与社区用户共同成长
邀请您加入社区
本文介绍了在Windows WSL2中通过GPU直连部署vLLM大模型推理引擎的完整方案,内容包括: 本地GPU推理的优势 相比云端API更经济、数据更安全 支持自定义模型和私有化部署 可充分利用闲置显卡资源 技术实现原理 WSL2通过DirectX GPU映射实现近乎无损的GPU直连 详细步骤验证GPU可用性 实践指导 vLLM安装配置方法 六大应用场景示例 离线推理与API服务部署 多GPU并
学习笔记 | 更新: 2026-06-05。
ClickHouse是一款开源列式存储OLAP数据库,专为海量数据分析设计,相比MySQL等行式数据库在聚合查询、实时报表等场景性能优势显著。本文为零基础用户提供ClickHouse一站式入门指南,涵盖核心概念、Linux原生部署和实战SQL操作。重点解析OLAP与OLTP的区别、列式存储原理,详细演示CentOS/Ubuntu系统安装配置(含远程连接、密码设置等生产级部署技巧),并通过用户行为分
相较于YOLOv8等前代模型,YOLOv11更适配SE110S边缘设备:推理速度提升15%-30%、模型体积更小、算子更规整,完美支持FP32/FP16/INT8多精度量化推理,INT8量化后可最大化发挥TPU算力,满足多路视频实时检测需求。:采用优化的C3k轻量化模块,替代前代C2f结构,精简冗余卷积分支,搭配SPPF空间金字塔池化,在降低算力消耗的同时,保留多尺度特征提取能力,适配SE110S
4.在dify中配置ollama添加模型的基础 URL中填写http://x.x.x.x:11434。3.在win11环境中查找WSL 的Hyper-V firewall的地址x.x.x.x。2.环境变量增加OLLAMA_HOST为0.0.0.0。1.win11的防火墙打开11434端口。
RAGFlow是部署在虚拟机里的,默认情况下,Ollama 只能允许本机访问(监听 localhost:11434),其他设备(比如虚拟机)是无法连接的。如果你的 Ollama 只想给自己的虚拟机使用,而不想直接暴露 11434 端口让任何设备都能访问,你可以通过SSH 端口转发来实现;OLLAMA_HOST=0.0.0.0:11434:让虚拟机里的程序能访问本机上运行的 Ollama 模型。可能
接上一篇关于Docker中的Ollama养虾的文章之后,这里补充一个Docker中部署Ollama模型的方案,通过这种方式建立一个完整的虚拟化环境,确保Ollama和OpenClaw在环境内的操作都相对可控。
【代码】【docker部署ollama】
注意:.ollama 文件夹是存放模型文件,来自与docker ollam:/root/.ollama 目录下。
在结束之际,我想重申的是,学习并非如攀登险峻高峰,而是如滴水穿石般的持久累积。尤其当我们步入工作岗位之后,持之以恒的学习变得愈发不易,如同在茫茫大海中独自划舟,稍有松懈便可能被巨浪吞噬。然而,对于我们程序员而言,学习是生存之本,是我们在激烈市场竞争中立于不败之地的关键。一旦停止学习,我们便如同逆水行舟,不进则退,终将被时代的洪流所淘汰。因此,不断汲取新知识,不仅是对自己的提升,更是对自己的一份珍贵
一、编写cicd部署到k8s集群上脚本name: Maven Package# 名称env: # 环境变量hostPath: /opt/project/teston: # 触发时间为创建发布(打tag)release:types: [created]jobs: # 任务build:runs-on: ...
SGLang 是一个专为大型语言模型(LLM)和视觉语言模型(VLM)设计的高性能服务框架,旨在提升模型交互的速度与可控性。它融合了高效的后端执行引擎与灵活的前端编程接口,助力构建更强大、智能的 AI 应用。其主要特点包括:RadixAttention 前缀缓存:加速长文本处理零开销 CPU 调度器 & 连续批处理:最大化硬件利用率分页注意力 & 推测解码:提升响应速度支持张量并行、分块预填充:高
docker 部署ollama
4、尝试使用本机IP地址调用http://192.168.10.10:11434连接不上,再仔细排查,原来默认情况下,Ollama 服务仅在本地运行,不对外提供服务。问题:本地刚搭建的ollama,部署了deepseek-r1,但随后部署的fastgpt却无法访问,提示connection error。4、在docker中调用ollama接口尝试,http://127.0.0.1:11434,竟然
dockerhub具有Create Automated Build,也就是说,将某处的dockerfile与dockerhub账户的某个repo相关联,那么,dockerhub的该repo就可以在docker端进行image的自建,而当我们需要该镜像时,直接将该镜像pull下来可以,不需要在本机进行build而github就是一个比较适合存放docker的地方!本文主要介绍2方面的内容:(1)如何
截至目前版本(),0.0.0.0,所以容器访问宿主机会超时。
使用vLLM容器部署开源模型,暴露一个 API 接口,使用另一个容器访问。
本文针对NVIDIA RTX 5090显卡部署Qwen3等大模型时出现的显存识别异常问题,提供了完整的解决方案。核心内容包括:标准部署流程(vLLM 0.7.0+启动命令、Docker配置要点)、三大典型问题排查(显存"失踪"、架构兼容性、Docker显存偏移)及对应的解决方案(强制Eager模式、精度优化、设备ID明确指定)。特别强调Blackwell架构需使用bfloat1
在此之前,我们已成功利用Docker与Ollama框架,在内网环境中部署了Qwen2模型。下面我们再来看一下使用Docker与vLLM框架部署Qwen2模型。
纯Docker部署Dify+vLLM+Ollama+Nginx