logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

什么是微服务

很多人听过“微服务”这个词,但听起来高大上,用起来像玄学。一提到微服务,脑子里全是“模块拆分”“服务治理”“注册发现”“容器编排”,仿佛一个词背后藏着三页 PPT 和十个中台部门。但说到底,微服务其实是程序员给“大工程拆小块”的一种架构风格。下面我们用“吃火锅”和“开餐馆”来举例讲讲:到底什么是微服务,它和普通开发有什么区别,为什么这么做效率更高。

#微服务#架构#云原生
公有云灾备

多区域部署结合自动容灾机制,是提升云上业务弹性和稳定性的关键技术方案。通过合理设计跨区域数据同步、全球流量调度及自动故障切换流程,可以最大程度降低区域性故障带来的业务中断风险。GCP 和 AWS 均提供完善的基础设施和服务支持,结合自动化运维手段,实现稳定、高效的跨区域容灾体系。

#linux
Prometheus如何精准捕捉容器运行时数据

容器不仅仅需要监控资源消耗(如 CPU、内存、磁盘、网络等),有时还需要监控容器内部应用的性能和业务指标。Prometheus 提供了很强的自定义指标支持,可以使用 Prometheus 提供的。

#prometheus
python和golang进程、线程、协程区别

•Python优点:生态丰富、脚本灵活、适合原型开发与数据处理。限制:GIL 阻碍多核并行、并发性能较弱。•Golang优点:协程模型强大、资源消耗低、天然适合构建高并发服务。特点:调度机制高效,适合服务器端通信密集型场景。•实际使用建议若任务是事件驱动型、面向接口服务调用,建议使用 Golang。若任务是数据处理类、AI 推理、脚本自动化,可优先考虑 Python。

#python#golang#java
Linux GPU管理

需矩阵尺寸对齐到8的倍数(FP16)或16的倍数(INT8):NVIDIA数据加载库,减少CPU-GPU数据传输。:通过InfiniBand实现GPU-GPU直接通信。:将Intel Optane作为GPU缓存。:NVIDIA的多进程共享技术。:A100/H100的硬件分区。:A100+支持的TEE环境。:将优化器状态卸载到CPU。:微软开发的极端压缩算法。:GPU直接访问PMEM。:自动优化多机

#linux#运维#服务器
Prometheus Alertmanager深度解析

Alertmanager作为Prometheus生态中的告警处理中枢,其设计哲学与实现机制值得深入探讨。本文将系统剖析其核心架构、关键特性,并给出跨集群统一告警的落地方案。

#prometheus
ROS2和FreeRTOS区别和联系

(Robot Operating System)是。FreeRTOS与ROS 2本质是。:FreeRTOS是。

#linux
大语言模型部署时怎么解决显存爆炸问题

显存爆炸是大语言模型部署中的常态问题,以下是应对方案的技术总结:INT4/INT8 量化压缩权重分片 + 懒加载分页缓存、自动回收、压缩Token-level 并发、异步 pipeline、CUDA Graph 缓存显存预分配池、激活复用、动态 rematerializationTensor/Pipeline/Hybrid 模型并行vLLM 提供最强 token 并发调度 + KV 缓存管理Tri

#语言模型#人工智能#自然语言处理
vLLM 原理与功能详解

vLLM 以高效、灵活和现代化的推理架构为核心,通过动态内存调度、异步 batch 执行和 Flash 解码等机制,大幅提升了大语言模型推理部署的效率和灵活度。上层 Web 框架:FastAPI / Flask模型与权重管理:Hugging Face Transformers + PEFT多实例负载均衡:Nginx / Envoy容器与部署:Docker / Kubernetes监控与告警:Pro

大语言模型部署时怎么解决显存爆炸问题

显存爆炸是大语言模型部署中的常态问题,以下是应对方案的技术总结:INT4/INT8 量化压缩权重分片 + 懒加载分页缓存、自动回收、压缩Token-level 并发、异步 pipeline、CUDA Graph 缓存显存预分配池、激活复用、动态 rematerializationTensor/Pipeline/Hybrid 模型并行vLLM 提供最强 token 并发调度 + KV 缓存管理Tri

#语言模型#人工智能#自然语言处理
    共 27 条
  • 1
  • 2
  • 3
  • 请选择