logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型训练必修课:梯度裁剪(Gradient Clipping)从数学原理,到PyTorch工程实战全解析

梯度裁剪是大模型训练中防止梯度爆炸、保障数值稳定性的核心技术。本文从零基础到工程实战,系统解析了梯度裁剪的数学原理与PyTorch落地细节。内容涵盖Clip by Norm的全局缩放机制与方向守恒证明、clip_grad_norm_ API参数深度拆解(含norm_type选型与foreach性能优化)、AMP混合精度下的正确调用时序,以及max_norm的动态监控与调优策略。文章还特别辨析了梯度

文章图片
#深度学习
一文搞懂大模型生成时的随机性控制:Top‑k + Temperature 核心逻辑与源码级拆解

本文系统解析大模型生成阶段随机性控制的核心机制,围绕Top-k采样与Temperature调节两大关键策略展开。内容涵盖多项式分布、温度缩放等数学原理的完整推导,并结合PyTorch源码对torch.multinomial、torch.gather及张量高级索引等底层算子进行逐行拆解,揭示高效采样函数的实现细节。文章兼顾理论深度与工程实践,提供可直接复用的代码示例,帮助读者从公式到代码全面掌握LL

文章图片
「Transformer核心必读」编码器层深度解析:从原理机制到 PyTorch 源码实现

本文深入剖析了 Transformer 模型的核心构建单元——编码器层(Encoder Layer)。文章首先从宏观角度阐述了编码器层如何通过自注意力机制(Self-Attention)将静态词嵌入转化为富含上下文语义的动态表示,解决了传统RNN/CNN在长距离依赖上的痛点。随后,本文详细拆解了编码器层的两大核心子层:多头自注意力(MHSA)负责建立全局依赖,位置前馈网络(FFN)负责非线性特征提

文章图片
「Transformer核心必读」编码器深度解析:架构拆解、数据流动方向、PyTorch代码实现

本文是对 Transformer 编码器(Encoder)的一次硬核深度拆解,从架构设计、数据流向到底层实现逐一剖析。文章首先系统梳理了多头自注意力、前馈网络与层归一化的协作机制,进而详细图解了数据从 Token 输入到上下文向量输出的全链路流动过程。同时,深入讲解了 PyTorch 中 nn.ModuleList 的正确用法及常见误区,并附带了可直接运行的 Encoder 模块复现代码。无论是校

文章图片
「Transformer核心必读」解码器Pre-LN架构、语义空间对齐与PyTorch实现

本文全方位解析Transformer解码器(Decoder)的核心架构与PyTorch实现。不同于常规教程,本文重点聚焦于Pre-LN架构的稳定性优势、Cross-Attention的语义空间对齐原理以及梯度回传路径的深度分析。通过数学推导与代码实战相结合,详细拆解了Masked Attention、子层连接等关键模块,帮助开发者从底层逻辑上彻底吃透大模型基石,提升架构设计与模型调试能力。

文章图片
「Transformer核心必读」Pre‑LN 解码器架构详解与 PyTorch 代码实现

本文聚焦于 Transformer 架构中采用 Pre‑Layer Normalization 的解码器主体部分,从整体堆叠设计到底层微观运算,系统深入地剖析了掩码自注意力、交叉注意力及前馈网络三大子模块的工作机制。同时,通过详细对比 Pre‑LN 与 Post‑LN 在梯度传播与训练稳定性上的差异,阐释了 Pre‑LN 成为主流工业标准的原因。文章不仅给出完整的数学形式化描述与参数量估算,还提供

文章图片
#transformer#pytorch#深度学习
2026标准:PyTorch Transformer参数初始化完全指南(附代码与避坑技巧)

在深度学习模型的训练过程中,参数初始化往往被视为决定模型“生死”的第一步。不合理的初始化策略极易引发梯度消失、梯度爆炸或模型输出NaN等顽疾,导致模型无法收敛。本文立足于2026年深度学习工业界的最新实践标准,深入剖析PyTorch框架下Transformer等大模型的参数初始化核心机制。文章不仅系统梳理了Xavier、Kaiming等经典初始化方法的数学原理与适用场景,更重点解读了如何利用PyT

文章图片
AdamW 深度解析:从数学原理到 PyTorch 实现,对比分析AdamW与Adam

AdamW 是现代深度学习(尤其是 Transformer、LLM)的事实标准优化器,但很多人并未真正理解它相比 Adam 的核心改进——“解耦权重衰减”。本文从数学原理出发,结合手算示例逐步推演,深度对比 Adam 与 AdamW 在耦合/解耦机制下的数值差异,并提供完整的 PyTorch API 详解、实践代码和 2000/20000 步训练趋势对比。阅读本文,你将彻底掌握 AdamW 的设计

文章图片
大模型训练必修课:梯度裁剪(Gradient Clipping)从数学原理,到PyTorch工程实战全解析

梯度裁剪是大模型训练中防止梯度爆炸、保障数值稳定性的核心技术。本文从零基础到工程实战,系统解析了梯度裁剪的数学原理与PyTorch落地细节。内容涵盖Clip by Norm的全局缩放机制与方向守恒证明、clip_grad_norm_ API参数深度拆解(含norm_type选型与foreach性能优化)、AMP混合精度下的正确调用时序,以及max_norm的动态监控与调优策略。文章还特别辨析了梯度

文章图片
#深度学习
一文搞懂大模型生成时的随机性控制:Top‑k + Temperature 核心逻辑与源码级拆解

本文系统解析大模型生成阶段随机性控制的核心机制,围绕Top-k采样与Temperature调节两大关键策略展开。内容涵盖多项式分布、温度缩放等数学原理的完整推导,并结合PyTorch源码对torch.multinomial、torch.gather及张量高级索引等底层算子进行逐行拆解,揭示高效采样函数的实现细节。文章兼顾理论深度与工程实践,提供可直接复用的代码示例,帮助读者从公式到代码全面掌握LL

文章图片
    共 49 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择