logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

c++平台下利用openvino对YOLOv5进行加速

(1)YOLO模块 (2) openvino模块下面分别介绍两个模块的安装流程。

文章图片
#python#c++#openvino
llm推理相关

我们知道llm推理是个自回归过程,所以模型会迭代地输入一个序列,采样下一个token,将该token附加到输入序列中,并继续此过程,直到LLM生成一个表示生成结束的token。(7)gpu加速和缓存,这其中注意力计算会占用很大的计算资源,尤其在多头注意力和长序列输入过程中,因此llm会利用gpu进行并行计算,在gpu内存中缓存query,key和value等矩阵提高计算效率。然后在gpu的支持下l

文章图片
#算法#深度学习#python
vllm2 架构解析

vllm1中讲了paged attention相关,这是整个vllm推理的原理基础。接下来我们看下vllm的推理架构。VLLM的核心组件:可以看到有两部分构成,左边是Scheduler,右边是worker。Scheduler负责请求调度,从等待队列中选择接下来要处理的请求。Worker负责模型推理,使用模型对被调度的请求进行推理。

文章图片
#架构
大模型量化常用方法

大模型权重值模型的部署的文件,叫权重。例如LAMMA 70B,权重的参数就有70B个。中间激活值a,就是在推理过程中的中间值。KVcache ,transformer中有K,Q,V三个矩阵。Q是每个token进来,K,V是需要重复计算的,例如我们已经输出了一个token,在输出第二个token的时候还需要计算第一个token的K V计算,说白了就是用内存换取速度的决定。,gradient是梯度,可

文章图片
#c++
cuda_1

cuda学习记录

文章图片
#算法#c++
大模型量化常用方法

大模型权重值模型的部署的文件,叫权重。例如LAMMA 70B,权重的参数就有70B个。中间激活值a,就是在推理过程中的中间值。KVcache ,transformer中有K,Q,V三个矩阵。Q是每个token进来,K,V是需要重复计算的,例如我们已经输出了一个token,在输出第二个token的时候还需要计算第一个token的K V计算,说白了就是用内存换取速度的决定。,gradient是梯度,可

文章图片
#c++
到底了