
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
标准多头注意力机制维度变换解析
这篇文章详细解析了多头注意力机制中的张量维度变换过程。通过Python代码演示,展示了从输入张量(batch_size=2, num_tokens=3, d_in=4)到最终输出的完整流程。关键步骤包括:1)线性投影生成Q/K/V矩阵;2)reshape操作将8维特征分割为2个头(每个头4维);3)转置操作调整维度顺序;4)计算注意力分数并应用因果掩码;5)softmax归一化;6)加权求和生成上
GPT模型架构详解
Embedding:离散 → 连续(进入神经网络的世界)Transformer:提取复杂的上下文依赖(核心计算)LayerNorm:稳定输出分布(为预测做准备)Linear Head:隐藏空间 → 词汇表空间(回到离散世界)
到底了







