logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型部署不盲目,是需要精确计算

本文分析了部署大语言模型(LLM)时GPU显存的分配情况,主要包括模型权重(65-80%)、KVCache(15-30%)和激活值/框架开销(2-5%)三部分。详细计算了不同精度(FP32/FP16/INT8/INT4)下模型权重和KVCache的显存占用,并以Llama-2-7B/70B为例进行实例分析。文章指出A100 80G显卡在FP16精度下最多可部署40B参数的模型,量化技术(FP8/I

文章图片
#人工智能
flink入门_flink简单学习_flink初识

flink入门学习flink 简单入手flink使用flink如何使用

文章图片
#flink#学习#scala
Flink配置Yarn日志聚合、配置历史日志。

yarn容器退出之后,默认是不保存日志的。所以需要开启JobHistoryServer. 无论Flink还是Spark都支持自建集群(standalone cluster)。但是为了保证稳定性和资源隔离等,生产环境里的任务最好借助资源管理框架(如Yarn)运行。任务运行在yarn上,查询日志就可能不是很方便,尤其是任务进程异常退出之后。..................

文章图片
#大数据#flink#yarn
到底了