logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

DeepSeek v4 Compressor kv cache压缩模块

DeepSeek v4 Compressor kv cache压缩模块

#DeepSeek
DeepSeek v4 Compressor kv cache压缩模块

DeepSeek v4 Compressor kv cache压缩模块

#DeepSeek
TensorRT Serialization assertion stdVersionRead == kSERIALIZATION_VERSION failed

[TRT] [E] IRuntime::deserializeCudaEngine: Error Code 1: Serialization (Serialization assertion stdVersionRead == kSERIALIZATION_VERSION failed.Version tag does not match. Note: Current Version: 237,

文章图片
#深度学习#人工智能
深度学习性能优化之图优化

这里总结了深度学习模型常见的部分图优化,有一些现有的深度学习框架已经有了,有些是作者的独特发现,现有深度学习框架还没有。

文章图片
#深度学习
克拉美罗下界 CRLB的计算

Cramer-Rao Lower Bound (CRLB)下界可以用于计算无偏估计中能够获得的最佳估计精度,因此经常用于计算理论能达到的最佳估计精度,和评估参数估计方法的性能(是否接近CRLB下界)。这里选择上传了几个讲解非常清楚的PPT:http://download.csdn.net/download/u013701860/10006266总的来说,CRLB的计算为以下几个步骤:1,构

大语言模型LLM权重4bit向量量化(Vector Quantization)/查找表量化基本原理

针对大语言模型权重的4bit量化,除了常规的广泛使用的group-wise均匀量化,如GPTQ, AWQ等等,苹果提出了一种称为Palettization的lookup table (LUT)查找表量化技术,高通也提出了新的一种向量量化技术,其实这两种技术原理基本上是相同的

文章图片
#语言模型#人工智能#自然语言处理
不同架构模型KV Cache大小计算

kv cache采用BF16存储时,每个token KV cache大小:第一个2是key和value两个张量,第二个2是BF16的dtype大小。

sglang Dense LLM PD分离部署

sglang Dense LLM PD分离部署

#sglang
DFlash推测解码和SGLang支持

DFLASH推测解码原理

文章图片
#sglang
    共 43 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择