logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Qwen3-32B大模型vLLM启动建议

多卡部署:若需使用多张卡部署(如 2 张、4 张 A100 80G),可按实际卡数调整该参数(如 2 张卡设为 2、4 张卡设为 4),多张卡的显存会联合承载模型权重,单卡显存要求会按比例降低(如 2 卡 float16 部署,单卡显存需 40GB+);,为 Qwen3-32B 模型的推理逻辑专属解析器,与工具调用配置配合使用,可优化模型推理和工具调用的衔接逻辑,建议保留该参数。,用于设置模型权重

qwen3-32b的maxToken设置建议

适用场景:写千字级文章、整段文档总结、多步骤分析报告、复杂代码工程maxToken 设置原因:Qwen3-32B 的 8k 上下文,预留 4k 左右给输入 prompt(足够承载千级汉字的长文本),4k 生成令牌能覆盖大部分长文本需求;不建议超过 4096,否则剩余输入空间过小,易丢失上下文。Qwen3-32B 的maxToken设置核心围绕8k 原生上下文基础硬边界:输入 + 生成令牌数 ≤ 8

#人工智能
vllm单机双卡部署Qwen3 30B FP8模型踩坑记录

想着KV cache也不小,能把这个减小了也行,尝试了一下,观察了vllm启动的日志,突然发现不一样了,如果kv-cache-dtype设置为fp8的话,vllm自动退回V0引擎启动模型(默认在Ampere、Hopper等较新的架构上使用V1引擎),然后就启动成功了!单位搞建设,配了台双4090的工作站,想着终于能部署个大点的模型了,根据显存大小,打算部署Qwen3的30B模型,结果反复遇到问题…

离线部署Qwen 和 DeepSeek

deepseek的每个大模型参数都那么大,还是没有qwen3.6-35b等更平民化。我是不是可以理解deepseek使用了更多的显存以空间换时间你的理解。更准确地说:DeepSeek 不是简单地“用更多显存换时间”,而是采用了,本质上是在。

#人工智能#算法
向量大模型升级可能改变向量空间(需要回归)

把 embedding 想成:模型把一句话变成一串数字(向量),并保证意思越近的两句话,向量越接近。这个“数字世界的坐标系”就是向量空间。

#回归#数据挖掘#人工智能
vllm启动大模型测试enforce-eager参数

2026-05-07T07:07:32.57启动开始。2026-05-07T06:44:35启动开始。2026-05-07T06:47:57启动完毕。2026-05-07T07:11:44启动完毕。大模型:Qwen3.6-35B-A3B。--enforce-eager开启。--enforce-eager关闭。

hub.docker.com和docker.com

是 Docker 官方的镜像仓库(Docker Hub)专属域名,也是 Docker 镜像相关的核心官网。补充:两者同属 Docker 官方域名,数据互通,登录 Docker Hub 的账号也可在。是 Docker 官方主站,而。

#docker#eureka#java
OpenResty

是一个基于与深度集成的,由章亦春(agentzh)于 2009 年创建。它将 Nginx 的事件驱动、高并发能力与 Lua 脚本的动态可编程性结合,让你能在 Nginx 内部直接编写业务逻辑,构建超高并发的动态服务OpenResty®。

#openresty
docker启动的时候挂载了/etc/localtime,docker logs -ft显示的时间还是慢8个小时,但容器内部date是正常的,怎么解决

这是最彻底的方案,让 Docker daemon 也使用和宿主机一致的东八区时区,之后新产生的日志都会自动使用正确的本地时间。这个脚本会自动把日志里的 UTC 时间加上 8 小时,转换成你需要的东八区时间,不需要修改任何系统配置。,旧的历史日志的时间戳已经是 UTC 格式,不会自动转换。,导致 Docker CLI 显示时间时用了错误的时区。如果要永久解决,需要检查你的。还有一种常见的小概率情况:

#docker#eureka#容器
    共 70 条
  • 1
  • 2
  • 3
  • 7
  • 请选择