logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

标准多头注意力机制维度变换解析

这篇文章详细解析了多头注意力机制中的张量维度变换过程。通过Python代码演示,展示了从输入张量(batch_size=2, num_tokens=3, d_in=4)到最终输出的完整流程。关键步骤包括:1)线性投影生成Q/K/V矩阵;2)reshape操作将8维特征分割为2个头(每个头4维);3)转置操作调整维度顺序;4)计算注意力分数并应用因果掩码;5)softmax归一化;6)加权求和生成上

#python#pytorch#深度学习 +1
GPT模型架构详解

Embedding:离散 → 连续(进入神经网络的世界)Transformer:提取复杂的上下文依赖(核心计算)LayerNorm:稳定输出分布(为预测做准备)Linear Head:隐藏空间 → 词汇表空间(回到离散世界)

#机器学习#深度学习#神经网络 +2
GPT模型架构详解

Embedding:离散 → 连续(进入神经网络的世界)Transformer:提取复杂的上下文依赖(核心计算)LayerNorm:稳定输出分布(为预测做准备)Linear Head:隐藏空间 → 词汇表空间(回到离散世界)

#机器学习#深度学习#神经网络 +2
到底了