logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

多头注意力模块 (Multi-Head Attention, MHA) 代码实现(pytorch)

定义一个继承自nn.Module的类。定义四个线性层,分别用于查询(Q)、键(K)、值(V)的变换和最终输出的投影。同时定义一个dropout层。

文章图片
#pytorch#人工智能#python
ROPE:大模型必学操作

泛化能力拉满:支持超长文本外推,训练短文本,推理长文本也能用计算效率高:不需要额外存储位置编码向量,推理时实时计算,节省内存相对位置感知:不仅能知道词的绝对位置,还能感知词与词之间的相对距离,更符合人类语言逻辑无缝集成:可以直接和Transformer的注意力机制融合,不用改模型的核心结构现在再回头看开头的问题,大模型之所以能区分"我爱吃苹果"和"苹果爱吃我",就是因为ROPE给每个词加了独特的位

文章图片
#算法#人工智能
RMSNorm:大模型的隐秘功臣?

RMSNorm的故事其实很有意思:它没有引入复杂的数学理论,也没有颠覆式的创新,只是对现有方法做了一次"减法"——去掉了看似必要但实际冗余的步骤,却在大模型时代发挥了巨大的价值。这也给我们一个启示:在AI技术的发展中,有时候最有效的创新不是"做加法",而是"做减法"——找到那些看似不可或缺,但实际上可以简化的环节,往往能带来意想不到的提升。从这个角度看,RMSNorm确实称得上是大模型的"隐秘功臣

文章图片
#人工智能#深度学习
大模型数值格式总结

大模型常用的数值格式主要分为两大类:浮点格式(遵循IEEE标准,由符号位+指数位+尾数位组成,原生存储小数)和整数量化格式(无指数位,通过将小数映射为固定区间整数来实现压缩)。核心规律位数越少,显存占用越小、计算速度越快,但精度越低。指数位越多,数值范围越大,越不易溢出。尾数位越多,小数精度越高。

文章图片
大模型推理框架总结解析

本文解析大模型推理框架的核心原理与主流方案。推理框架通过模型加载优化、计算图优化、推理调度和硬件适配等关键技术,提升大模型部署效率。重点对比了vLLM、TensorRT-LLM等主流框架:vLLM采用PagedAttention技术实现高并发处理,TensorRT-LLM则通过算子融合优化计算性能。文章为开发者选型提供了技术参考,涵盖框架原理、核心技术与优缺点分析,帮助根据实际需求选择适合的推理解

#算法
ROPE:大模型必学操作

泛化能力拉满:支持超长文本外推,训练短文本,推理长文本也能用计算效率高:不需要额外存储位置编码向量,推理时实时计算,节省内存相对位置感知:不仅能知道词的绝对位置,还能感知词与词之间的相对距离,更符合人类语言逻辑无缝集成:可以直接和Transformer的注意力机制融合,不用改模型的核心结构现在再回头看开头的问题,大模型之所以能区分"我爱吃苹果"和"苹果爱吃我",就是因为ROPE给每个词加了独特的位

文章图片
#算法#人工智能
RMSNorm:大模型的隐秘功臣?

RMSNorm的故事其实很有意思:它没有引入复杂的数学理论,也没有颠覆式的创新,只是对现有方法做了一次"减法"——去掉了看似必要但实际冗余的步骤,却在大模型时代发挥了巨大的价值。这也给我们一个启示:在AI技术的发展中,有时候最有效的创新不是"做加法",而是"做减法"——找到那些看似不可或缺,但实际上可以简化的环节,往往能带来意想不到的提升。从这个角度看,RMSNorm确实称得上是大模型的"隐秘功臣

文章图片
#人工智能#深度学习
啥是大模型GGUF格式

如果你最近在折腾开源大模型,尤其是在个人电脑、树莓派这类边缘设备上跑模型,大概率会碰到GGUF这个格式。它不像PyTorch的.pt或者TensorFlow的.pb那么“正统”,但却是当下圈里最火的轻量化模型格式之一,今天就把它的来龙去脉说清楚。

文章图片
#人工智能
大模型数值格式总结

大模型常用的数值格式主要分为两大类:浮点格式(遵循IEEE标准,由符号位+指数位+尾数位组成,原生存储小数)和整数量化格式(无指数位,通过将小数映射为固定区间整数来实现压缩)。核心规律位数越少,显存占用越小、计算速度越快,但精度越低。指数位越多,数值范围越大,越不易溢出。尾数位越多,小数精度越高。

文章图片
    共 25 条
  • 1
  • 2
  • 3
  • 请选择