
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文探讨了如何将传统的Git CLI工具扩展为支持自然语言交互的智能助手,通过对话式Agent Loop模式消除传统命令行工具的痛点。文章对比了两种方式的差异,分析了架构演进过程,并详细介绍了Agent Loop、会话记忆和工具注册中心的实现机制。

本文系统分析了注意力机制中Q、K、V来源的合法组合及其数学约束。通过矩阵维度分析,指出K和V必须来自同一序列,从而筛选出4种合法组合。重点对比了标准交叉注意力(Y,X)和反向交叉注意力(X,Y)的本质差异:前者将源序列信息流向目标序列,用于翻译生成;后者反向将目标信息融入源序列,适用于双向任务。通过数值算例和代码验证,证明了两种结构在权重矩阵、信息流向和梯度传播上的不可逆性。这些组合为Transf

摘要:本文详细解析了Transformer中的交叉注意力机制(Cross-Attention),重点解决编码器与解码器之间的信息传递问题。传统Seq2Seq模型将源序列压缩为固定向量导致信息丢失,而交叉注意力通过动态查询机制实现精准的词对齐——解码器生成每个目标词时,能主动聚焦源序列中最相关的词(如生成"i"时关注"我")。文章通过数学推导展示了交叉注意力与

本文深入解析了Transformer架构中的子层连接结构,重点探讨了残差连接与层归一化如何协同工作以解决深层网络梯度消失问题。文章对比了原论文Post-LN与改进版Pre-LN的结构差异,通过数学推导证明残差连接能保持梯度恒等性,使Transformer可堆叠数十层。研究表明,Post-LN虽需学习率预热但能保证特征分布一致性,而Pre-LN训练更稳定,成为当前主流。最后通过d_model=2的数

本文深入解析了Transformer模型中的前馈网络(FFN)子层,揭示了其与注意力机制的互补关系。FFN通过"升维-非线性激活-降维"的三步结构(公式为FFN(x)=max(0,xW1+b1)W2+b2),在保持输入输出维度一致的同时,显著提升了模型的特征表达能力。其中,ReLU激活函数引入非线性变换,升维操作(通常dff=4×dmodel)提供更丰富的特征空间,使模型能够拟

本文深入解析Transformer中的掩码机制,重点阐述了三种核心掩码的数学本质和实现原理。首先通过负无穷偏置的数学操作,说明掩码如何在不影响梯度传播的前提下实现注意力屏蔽。然后系统拆解三类掩码:编码器Padding掩码(屏蔽无效补零位置)、解码器未来掩码(保证自回归特性)和解码器Padding掩码,并通过矩阵运算展示其合并逻辑。最后通过长度为3的序列实例,手算验证双掩码如何共同修正注意力权重分布

本文详细拆解了Transformer编码器的完整结构,包括输入层的词嵌入与位置编码、堆叠的编码器层(多头自注意力+前馈网络)以及最终输出。通过数学推导和维度分析,展示了编码器如何将源序列转换为包含上下文信息的高维特征。文章还包含一个"我爱深度学习"的数值实例,直观演示自注意力机制如何捕捉词间依赖关系,并提供了与原始论文对齐的PyTorch实现。编码器的核心在于通过残差连接和层归

在第 33 篇中,我们系统地构建了 Transformer 编码器的完整架构。编码器负责将源序列映射为丰富的上下文表征,但它无法自行生成序列——这正是解码器的职责。解码器作为自回归生成的核心引擎,通过三大子层的协同工作实现序列生成:三者通过残差连接与层归一化有机结合,形成可深度堆叠的解码器层。本文将沿着"数学原理→手动实例→代码验证"的固定结构展开:Transformer 解码器的整体架构可表示为

在前面的文章中,我们分别完成了编码器(第 33 篇)和解码器(第 34 篇)的前向传播数值计算。但前向传播只是模型推理的一半,真正的学习发生在反向传播过程中——当我们把预测结果与真实标签比较,求出误差关于每个参数的梯度,然后沿着梯度方向更新参数,模型的预测才会一步步变准。本文的目标是:以的机器翻译为例,首次在专栏中完整手算 Transformer 的一轮训练迭代(前向 → 损失 → 反向 → 参数

本文是Transformer编码器代码实战的第一部分,通过PyTorch实现编码器各组件并进行数值验证。采用字符级分词(中文逐字/英文逐字母)构建小词表(中文1106字/英文54字符),使注意力模式更直观。重点实现了位置编码的可视化展示,揭示其低频到高频的频谱结构,并通过手动计算验证公式正确性。模型配置为3层编码器(d_model=32,4头注意力,FFN隐藏层128维)。配套notebook提供








