
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文介绍了如何基于Docker+Kubernetes+Helm+Istio技术栈实现vLLM推理服务的全流程部署与灰度发布。主要内容包括:1) 使用Docker构建vLLM推理服务镜像;2) 通过Helm Chart封装部署模板;3) 配置HPA实现自动扩缩容;4) 利用Istio实现90/10的流量灰度发布(Canary)。重点解决了Istio路由必须使用FQDN、服务端口命名规范等技术难点,最
摘要: 在ARM64设备上运行AMD64架构的Docker镜像时,常因CPU指令集不兼容导致exec format error错误。通过QEMU用户态模拟和binfmt_misc内核机制协同工作,ARM64设备可动态翻译并执行AMD64程序。解决方案包括:安装qemu-user-static工具、注册QEMU解释器、验证配置后使用--platform linux/amd64运行容器。此方法适用于树
摘要: 在ARM64设备上运行AMD64架构的Docker镜像时,常因CPU指令集不兼容导致exec format error错误。通过QEMU用户态模拟和binfmt_misc内核机制协同工作,ARM64设备可动态翻译并执行AMD64程序。解决方案包括:安装qemu-user-static工具、注册QEMU解释器、验证配置后使用--platform linux/amd64运行容器。此方法适用于树
摘要:vLLM服务启动后端口监听正常,但访问时卡住的常见问题,通常是由于旧进程TCP句柄残留(CLOSE_WAIT状态)导致端口复用引发。通过netstat和lsof可定位多个进程监听同一端口的情况,解决方案是彻底清理旧进程(pkill -f vllm)并重启服务。建议生产环境使用进程托管工具,避免频繁重启时出现句柄残留。该问题与模型加载无关,属于TCP连接管理范畴。







