logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

python和golang进程、线程、协程区别

•Python优点:生态丰富、脚本灵活、适合原型开发与数据处理。限制:GIL 阻碍多核并行、并发性能较弱。•Golang优点:协程模型强大、资源消耗低、天然适合构建高并发服务。特点:调度机制高效,适合服务器端通信密集型场景。•实际使用建议若任务是事件驱动型、面向接口服务调用,建议使用 Golang。若任务是数据处理类、AI 推理、脚本自动化,可优先考虑 Python。

#python#golang#java
Linux GPU管理

需矩阵尺寸对齐到8的倍数(FP16)或16的倍数(INT8):NVIDIA数据加载库,减少CPU-GPU数据传输。:通过InfiniBand实现GPU-GPU直接通信。:将Intel Optane作为GPU缓存。:NVIDIA的多进程共享技术。:A100/H100的硬件分区。:A100+支持的TEE环境。:将优化器状态卸载到CPU。:微软开发的极端压缩算法。:GPU直接访问PMEM。:自动优化多机

#linux#运维#服务器
Prometheus Alertmanager深度解析

Alertmanager作为Prometheus生态中的告警处理中枢,其设计哲学与实现机制值得深入探讨。本文将系统剖析其核心架构、关键特性,并给出跨集群统一告警的落地方案。

#prometheus
ROS2和FreeRTOS区别和联系

(Robot Operating System)是。FreeRTOS与ROS 2本质是。:FreeRTOS是。

#linux
大语言模型部署时怎么解决显存爆炸问题

显存爆炸是大语言模型部署中的常态问题,以下是应对方案的技术总结:INT4/INT8 量化压缩权重分片 + 懒加载分页缓存、自动回收、压缩Token-level 并发、异步 pipeline、CUDA Graph 缓存显存预分配池、激活复用、动态 rematerializationTensor/Pipeline/Hybrid 模型并行vLLM 提供最强 token 并发调度 + KV 缓存管理Tri

#语言模型#人工智能#自然语言处理
vLLM 原理与功能详解

vLLM 以高效、灵活和现代化的推理架构为核心,通过动态内存调度、异步 batch 执行和 Flash 解码等机制,大幅提升了大语言模型推理部署的效率和灵活度。上层 Web 框架:FastAPI / Flask模型与权重管理:Hugging Face Transformers + PEFT多实例负载均衡:Nginx / Envoy容器与部署:Docker / Kubernetes监控与告警:Pro

大语言模型部署时怎么解决显存爆炸问题

显存爆炸是大语言模型部署中的常态问题,以下是应对方案的技术总结:INT4/INT8 量化压缩权重分片 + 懒加载分页缓存、自动回收、压缩Token-level 并发、异步 pipeline、CUDA Graph 缓存显存预分配池、激活复用、动态 rematerializationTensor/Pipeline/Hybrid 模型并行vLLM 提供最强 token 并发调度 + KV 缓存管理Tri

#语言模型#人工智能#自然语言处理
jenkins

本文将系统剖析其核心架构、关键特性,并给出生产环境的最佳实践方案。

#jenkins#运维
vLLM 原理与功能详解

vLLM 以高效、灵活和现代化的推理架构为核心,通过动态内存调度、异步 batch 执行和 Flash 解码等机制,大幅提升了大语言模型推理部署的效率和灵活度。上层 Web 框架:FastAPI / Flask模型与权重管理:Hugging Face Transformers + PEFT多实例负载均衡:Nginx / Envoy容器与部署:Docker / Kubernetes监控与告警:Pro

大语言模型部署时怎么解决显存爆炸问题

显存爆炸是大语言模型部署中的常态问题,以下是应对方案的技术总结:INT4/INT8 量化压缩权重分片 + 懒加载分页缓存、自动回收、压缩Token-level 并发、异步 pipeline、CUDA Graph 缓存显存预分配池、激活复用、动态 rematerializationTensor/Pipeline/Hybrid 模型并行vLLM 提供最强 token 并发调度 + KV 缓存管理Tri

#语言模型#人工智能#自然语言处理
    共 24 条
  • 1
  • 2
  • 3
  • 请选择