logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【大模型推理优化】KV Cache 从0到1彻底详解

KV Cache是一种优化大模型自回归推理的技术,通过缓存历史token的K、V特征避免重复计算。在Decoder-only架构中,模型逐token生成文本时,原生推理需反复计算整个序列的Q、K、V矩阵,导致O(N²)复杂度。KV Cache通过预填充(Prefill)阶段缓存初始Prompt的K、V,解码(Decode)阶段仅计算新token的特征并拼接历史缓存,将复杂度降至O(N)。

文章图片
#深度学习#自然语言处理#人工智能 +1
【大模型推理优化】KV Cache 从0到1彻底详解

KV Cache是一种优化大模型自回归推理的技术,通过缓存历史token的K、V特征避免重复计算。在Decoder-only架构中,模型逐token生成文本时,原生推理需反复计算整个序列的Q、K、V矩阵,导致O(N²)复杂度。KV Cache通过预填充(Prefill)阶段缓存初始Prompt的K、V,解码(Decode)阶段仅计算新token的特征并拼接历史缓存,将复杂度降至O(N)。

文章图片
#深度学习#自然语言处理#人工智能 +1
【大模型推理优化】KV Cache 从0到1彻底详解

KV Cache是一种优化大模型自回归推理的技术,通过缓存历史token的K、V特征避免重复计算。在Decoder-only架构中,模型逐token生成文本时,原生推理需反复计算整个序列的Q、K、V矩阵,导致O(N²)复杂度。KV Cache通过预填充(Prefill)阶段缓存初始Prompt的K、V,解码(Decode)阶段仅计算新token的特征并拼接历史缓存,将复杂度降至O(N)。

文章图片
#深度学习#自然语言处理#人工智能 +1
git出现Permission denied问题

git出现Permission denied问题

文章图片
#git
ChatGLM推理报错RuntimeError: probability tensor contains either `inf`, `nan` or element < 0

ChatGLM推理报错RuntimeError: probability tensor contains either `inf`, `nan` or element < 0

位置编码:绝对位置编码、相对位置编码、旋转位置编码

模型本身是“无状态”的,它看不到句子里单词的顺序(比如“我吃苹果”和“苹果吃我”,在模型眼里如果不做处理,输入的token是一样的),那它怎么区分语序、理解语义呢?答案就是「位置编码」——它就像给每个单词贴了一个“坐标标签”,告诉模型“这个单词在句子里排第1位、那个排第3位”,让模型能捕捉到语序带来的语义差异。

文章图片
#transformer#深度学习#人工智能 +1
遗传算法的基本原理

遗传算法即模拟自然界中种群优胜劣汰的过程,通过种群不断迭代之后找到最优解。其实现步骤可分为:编码,解码,个体适应度评估,复制,交叉,变异。个体适应度评估即把x的值带入到目标函数。总结:大范围广度搜索-前期设置种群数量(随机样本)小范围精度搜索-交叉、变异有跳出局部最优的能力(突变)...

    共 19 条
  • 1
  • 2
  • 请选择