
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
国产替代实战系列(三):性能优化——填补算力、显存与带宽的三大 Gap
性能优化主要看哪些地方

大模型推理性能 Benchmark 实践:vLLM vs TensorRT-LLM (基于 Llama 3.1 8B)
VLLM 和 TensorRT-LLM对比,两个框架各有优势,怎么对比可以看看。

Docker + K8s 部署大模型推理服务:资源划分与多实例调度
本文系统介绍了大语言模型推理服务的容器化部署方案。针对模型体积大、计算密集的特点,提出基于Docker和Kubernetes的生产级部署方法,包括:1)使用NVIDIA官方镜像构建Dockerfile;2)配置K8s Deployment实现多实例管理;3)优化GPU资源分配策略。重点阐述了vLLM推理引擎的容器化封装、健康检查探针设置、GPU调度规则等核心环节,并给出7B/14B模型的具体资源配

大模型量化部署进阶:从 INT8/INT4 原理到高性能推理实战
量化的逻辑是什么,大家可以看看

手把手教你分析深度学习目标检测模型——以YOLOv5为例
面试题,最直接的方式是给你一个模型让你来对这个模型进行分析,那么你至少要能够说出来它是什么吧,说出来它的内部做了什么吧

【无声音的画像——当深度学习遇上 MFCC标题】
声音是怎么识别的? 其实它和视觉是一样的,只是它看的不是图片而是频谱,而是mfcc特征

K8s 完整知识体系(含架构图)
k8s的相关知识汇总,我认为重要的东西。 容器编排作为现在互联网厂商必备的工具还是很有必要多一些它的文章的。

动态大模型 Prompt 生成技术解析
我们这个文章来讲下动态prompt生成,它是怎么做的?

解剖 GPU 显存:多轮对话中大模型为什么会遭遇 OOM 噩梦?
我们已经知道了,大语言模型在推理过程中会产生很多的kvcache,那么如何处理这些kvcache?









