logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型推理引擎vLLM(22):怎么添加一个CLI参数以及命令行参数的解析、传递链路代码梳理

大模型推理引擎vLLM(22):怎么添加一个CLI参数以及命令行参数的解析、传递链路代码梳理

大模型推理引擎vLLM(25): 从--kv-cache-dtype fp8_e5m2时gsm8k答非所问的bug梳理kv cache相应代码片段

大模型推理引擎vLLM(25): 从--kv-cache-dtype fp8_e5m2时gsm8k答非所问的bug梳理kv cache相应代码片段

大模型推理引擎vLLM(30):由一个GLM5 bug,整理MLP中的SwiGLU、算子融合、量化相关问题

大模型推理引擎vLLM(30):由一个GLM5 bug,整理MLP中的SwiGLU、算子融合、量化相关问题

#bug
大模型推理引擎vLLM(27): TP场景moe与EP场景MOE的相同点和不同点、使用modular_kernel.py的差异

大模型推理引擎vLLM(27): TP场景moe与EP场景MOE的相同点和不同点、使用modular_kernel.py的差异

大模型推理引擎vLLM(21): vllm0.21.0中EP基类代码modular_kernel.py详细走读

大模型推理引擎vLLM(21): vllm0.21.0中EP基类代码modular_kernel.py详细走读

大模型推理引擎 vLLM(28):custom_all_reduce 单机/跨节点原理(IPC、Fabric、HSA)

大模型推理引擎 vLLM(28):custom_all_reduce 单机/跨节点原理(IPC、Fabric、HSA)

#fabric
大模型推理引擎vLLM(29): 参考sglang代码,重构vllm021中EP高吞吐代码,消除空泡问题:400us减小到25us

大模型推理引擎vLLM(30): 参考sglang代码,重构vllm021中MOE EP高吞吐代码,消除空泡问题:400us减小到25us

#sglang
大模型权重的B/T参数量、显存估算、MoE与Dense模型加载区别以及EP相关问题整理

大模型权重的B/T参数量、显存估算、MoE与Dense模型加载区别以及EP相关问题整理

海思芯片中VPSS的group和channel的概念.

在芯片中VPSS可能只有一个或者两个,然后我们要去复用这个vpss,那么我们就申请一个VPSS号,这样好像有很多个VPSS,实际上我们用的都是同一个硬件VPSS,这里申请的VPSS号就是GROUP,海思中有一个很重要的思想就是复用的思想.还有就是channel,这里每个VPSS group可以有多路输出,而且每个channel的输出实现的功能不一样.但是每个group仅可以和一个输入源进行绑定..

常用的相似度计算方法----欧式距离、曼哈顿距离、马氏距离、余弦、汉明距离、切比雪夫距离、闵可夫斯基距离、马氏距离

在深度学习以及图像搜索中,经常要对特征值进行比对,得到特征的相似度,常见的特征值比对方法有汉明距离、余弦距离、欧式距离、曼哈顿距离、切比雪夫距离、闵可夫斯基距离、马氏距离等,下面对各种比对方法分别进行介绍。1汉明距离汉明距离/Hamming Distance也能用来计算两个向量的相似度;即通过比较向量每一位是否相同,若不同则汉明距离加1,这样得到汉明距离。向量相似度越高,对应的汉明距离越小。如10

    共 92 条
  • 1
  • 2
  • 3
  • 10
  • 请选择