logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

vllm deepseek model中输入参数说明

混合位置编码:通过和实现参数效率:使用LoRA减少可训练参数量扩展性:支持长序列处理和模型量化灵活性:每个组件都可以独立配置这样的设计让模型在保持高性能的同时,大幅降低了计算和存储需求。

#人工智能
python 中全局锁理解

情况效果原因严格排队单工作线程,任务顺序执行+ CPU密集型有限并发GIL限制真正并行,但线程切换提供并发+ I/O密集型良好并发I/O操作释放GIL,线程可真正并行处理场景效果解释单线程Worker遇到CPU操作阻塞Worker和事件循环Worker-1持有GIL进行计算,事件循环抢不到GIL,被阻塞。单线程Worker遇到I/O操作不阻塞事件循环Worker-1主动释放GIL,事件循环可以立即

#python#java#jvm
vllm中生成token的流程

请求1:输入token [t0, t1] → 需要t1的hidden state来生成t2请求2:输入token [t0, t1, t2] → 需要t2的hidden state来生成t3请求3:输入token [t0] → 需要t0的hidden state来生成t1。

#人工智能
pytorch中的函数参数dim详解

对于刚入门的新手来说,Torch API中的维度真的很迷惑人.例如 torch.sum(x, dim=0) 是按着行相加呢,还是列相加?还有TopK,softmax等函数。

#pytorch#人工智能#python
python 中全局锁理解

情况效果原因严格排队单工作线程,任务顺序执行+ CPU密集型有限并发GIL限制真正并行,但线程切换提供并发+ I/O密集型良好并发I/O操作释放GIL,线程可真正并行处理场景效果解释单线程Worker遇到CPU操作阻塞Worker和事件循环Worker-1持有GIL进行计算,事件循环抢不到GIL,被阻塞。单线程Worker遇到I/O操作不阻塞事件循环Worker-1主动释放GIL,事件循环可以立即

#python#java#jvm
pytorch 操作之squeeze

python运行# 创建一个最后一维尺寸为 1 的张量print("原始张量形状:", x.shape) # 输出: torch.Size([3, 1])# 移除最后一个维度print("操作后张量形状:", y.shape) # 输出: torch.Size([3])print(y)# 输出: tensor([1, 2, 3])这里,原始张量是形状为[3, 1]的二维张量,通过移除了最后一个维度

#pytorch#人工智能#python
deepseek 中two batch overlap学习

https://zhuanlan.zhihu.com/p/1910048095816877891

#学习
cuda中Cooperative Groups学习

https://zhuanlan.zhihu.com/p/659200094

#学习#人工智能
到底了