
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Flask暴露大模型接口

KV Cache是一种优化大模型自回归推理的技术,通过缓存历史token的K、V特征避免重复计算。在Decoder-only架构中,模型逐token生成文本时,原生推理需反复计算整个序列的Q、K、V矩阵,导致O(N²)复杂度。KV Cache通过预填充(Prefill)阶段缓存初始Prompt的K、V,解码(Decode)阶段仅计算新token的特征并拼接历史缓存,将复杂度降至O(N)。

KV Cache是一种优化大模型自回归推理的技术,通过缓存历史token的K、V特征避免重复计算。在Decoder-only架构中,模型逐token生成文本时,原生推理需反复计算整个序列的Q、K、V矩阵,导致O(N²)复杂度。KV Cache通过预填充(Prefill)阶段缓存初始Prompt的K、V,解码(Decode)阶段仅计算新token的特征并拼接历史缓存,将复杂度降至O(N)。

大语言模型微调过程

KV Cache是一种优化大模型自回归推理的技术,通过缓存历史token的K、V特征避免重复计算。在Decoder-only架构中,模型逐token生成文本时,原生推理需反复计算整个序列的Q、K、V矩阵,导致O(N²)复杂度。KV Cache通过预填充(Prefill)阶段缓存初始Prompt的K、V,解码(Decode)阶段仅计算新token的特征并拼接历史缓存,将复杂度降至O(N)。

git出现Permission denied问题

ChatGLM推理报错RuntimeError: probability tensor contains either `inf`, `nan` or element < 0
模型本身是“无状态”的,它看不到句子里单词的顺序(比如“我吃苹果”和“苹果吃我”,在模型眼里如果不做处理,输入的token是一样的),那它怎么区分语序、理解语义呢?答案就是「位置编码」——它就像给每个单词贴了一个“坐标标签”,告诉模型“这个单词在句子里排第1位、那个排第3位”,让模型能捕捉到语序带来的语义差异。

遗传算法即模拟自然界中种群优胜劣汰的过程,通过种群不断迭代之后找到最优解。其实现步骤可分为:编码,解码,个体适应度评估,复制,交叉,变异。个体适应度评估即把x的值带入到目标函数。总结:大范围广度搜索-前期设置种群数量(随机样本)小范围精度搜索-交叉、变异有跳出局部最优的能力(突变)...







