logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

《从零构建大模型》系列(15):编码单词位置信息——让大语言模型理解顺序的魔法

位置编码是Transformer架构中赋予模型理解词序能力的关键组件。文章系统阐述了位置编码的重要性、实现方式和前沿发展。自然语言的语义高度依赖词序,而自注意力机制本身不具备位置感知能力,必须通过位置编码来弥补这一缺陷。主流方案分为绝对位置编码和相对位置编码两大流派,前者为每个位置分配唯一向量,后者则建模词元间的相对距离关系。文章详细对比了GPT系列、Transformer和RoPE等不同模型的位

文章图片
#语言模型#android#人工智能
《从零构建大模型》系列(13):滑动窗口采样——大语言模型的数据引擎

本文深入探讨了大语言模型训练中的核心数据处理技术——滑动窗口算法及其工业级实现。主要内容包括:1) 解析输入-目标对作为大模型训练基础,展示滑动窗口采样的数学形式和可视化;2) 提供基础滑动窗口实现代码,包括单步采样、步幅策略对比;3) 详述PyTorch Dataset设计,实现内存映射优化和支持超大规模数据集的MMapGPTDataset;4) 分析三种采样模式性能,显示分块采样在1GB文本上

文章图片
#语言模型#人工智能#算法
《从零构建大模型》系列(12):BPE算法——大语言模型的分词基石

BPE算法:现代语言模型的分词核心技术 BPE(Byte Pair Encoding)算法通过动态合并高频字符对的方式,完美解决了传统分词方法在词表大小和OOV问题之间的权衡难题。本文系统性地介绍了BPE的核心原理、实现方法和优化策略,包括: 算法流程解析与可视化演示 从基础到优化的完整实现代码 GPT系列采用的字节级BPE创新 与传统分词算法的性能对比 训练实践中的参数配置与陷阱规避 BPE通过

文章图片
#语言模型#人工智能#自然语言处理
《从零构建大模型》系列(19):实现带可训练权重的自注意力机制——大语言模型的核心引擎

本文详细解析了可训练自注意力机制的实现原理与应用。文章首先解释了可训练权重的重要性,包括增强模型适应性和表达能力等核心优势。随后分步演示了自注意力机制的完整实现过程:从初始化权重矩阵、计算QKV向量,到注意力分数计算、缩放归一化,最终生成上下文向量。文中对比了两种实现方式(基础参数实现与优化线性层实现),并深入探讨了缩放点积注意力的数学原理。此外,文章还分析了自注意力在GPT等大模型中的实际应用配

文章图片
#语言模型#人工智能#自然语言处理
《从零构建大模型》系列(20):因果注意力——大语言模型的核心安全机制

因果注意力是确保语言模型生成连贯文本的关键技术,它通过掩码机制防止模型"作弊"访问未来信息。本文系统讲解了因果注意力的实现原理、PyTorch实现步骤,并对比了标准注意力与因果注意力的差异。重点内容包括:1) 基础实现类与设备感知技巧;2) 注意力Dropout的正则化作用;3) 批处理优化方法;4) 从可视化分析到实际文本生成应用;5) 高级变体如滑动窗口和分块注意力。文章还

文章图片
#语言模型#深度学习#人工智能
《从零构建大模型》系列(14):词元嵌入——语言的高维密码本

本文系统阐述了神经网络中词嵌入层的核心原理与技术实现。主要内容包括:1)嵌入层将离散符号映射到连续向量空间的数学本质;2)PyTorch实现及GPT等大模型的嵌入架构剖析;3)嵌入维度选择、权重初始化、参数共享等12项关键技术;4)位置编码的演进与最新实践。文章通过可视化分析揭示了嵌入空间的语义特征,比较了不同模型的实现差异,并提供了参数配置的黄金法则。最后探讨了动态嵌入、量子化嵌入等前沿方向,为

文章图片
#人工智能
《从零构建大模型》系列(23):深入解析GELU激活函数与Transformer前馈神经网络实现

深入探讨了 Transformer 架构中前馈神经网络的关键作用,以及 GELU 激活函数相较于传统 ReLU 的优势。文章指出 ReLU 在深度网络中的局限性,如负区梯度为零导致的神经元死亡问题,而 GELU 通过输入值的概率加权,使负信号也能参与学习,且处处可导。详细介绍了 GELU 的精确计算与工程近似方法,并给出了 PyTorch 实现代码,还将其与 ReLU 进行直观对比。在前馈网络实现

文章图片
#transformer#神经网络#深度学习
《从零构建大模型》系列(20):因果注意力——大语言模型的核心安全机制

因果注意力是确保语言模型生成连贯文本的关键技术,它通过掩码机制防止模型"作弊"访问未来信息。本文系统讲解了因果注意力的实现原理、PyTorch实现步骤,并对比了标准注意力与因果注意力的差异。重点内容包括:1) 基础实现类与设备感知技巧;2) 注意力Dropout的正则化作用;3) 批处理优化方法;4) 从可视化分析到实际文本生成应用;5) 高级变体如滑动窗口和分块注意力。文章还

文章图片
#语言模型#深度学习#人工智能
《从零构建大模型》系列(23):深入解析GELU激活函数与Transformer前馈神经网络实现

深入探讨了 Transformer 架构中前馈神经网络的关键作用,以及 GELU 激活函数相较于传统 ReLU 的优势。文章指出 ReLU 在深度网络中的局限性,如负区梯度为零导致的神经元死亡问题,而 GELU 通过输入值的概率加权,使负信号也能参与学习,且处处可导。详细介绍了 GELU 的精确计算与工程近似方法,并给出了 PyTorch 实现代码,还将其与 ReLU 进行直观对比。在前馈网络实现

文章图片
#transformer#神经网络#深度学习
《从零构建大模型》系列(6):深入GPT架构——从原理到ChatGPT的进化之路

本文系统解析了GPT系列模型的架构演进与核心技术。从117M参数的GPT-1到1.8T参数的GPT-4,模型通过纯解码器Transformer架构实现质的飞跃,其核心在于自监督的"预测下一个词"任务。文章详细剖析了GPT-3的1750亿参数分布、并行计算优化和涌现能力产生机制,并对比了RLHF技术带来的对话能力提升。同时介绍了LLaMA等开源替代方案的技术创新,提供了300行P

文章图片
#人工智能
    共 15 条
  • 1
  • 2
  • 请选择