logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

python神经网络编程入门(四十)——分词与数据管线:BPE 子词切分

从这一章起进入"预训练篇":我们要理解 BERT、GPT 真实大模型,而大模型吃的第一口饭是数字。这一章解决"文字怎么变成数字":为什么不能用整词(词表爆炸+OOV),也不能用单字符(序列太长)?什么是 BPE 子词切分?它如何从语料里一步步合并出子词,让新词永不 OOV、还能无损还原?全章用纯 Python 手写八个示例:三种切分对比、BPE 训练(经典语料逐轮打印合并规则)、编码、解码、中文语

文章图片
python神经网络编程入门(三十九)——训练细节:标签平滑、AdamW 与学习率调度

第 9 章我们把 Transformer 这台"发动机"装好并通过了全部自检——但就像新电脑没有操作系统,机器只会"均匀地说废话"。这一章装操作系统,而且一装就是三件套:**标签平滑(Label Smoothing)**、**AdamW 优化器**、**warmup 学习率调度**。文章不满足于"记住三个名词",而是把每一件都拆到数学和数字里:标签平滑为什么能把"最优 logits 从 +∞ 拽回

文章图片
python神经网络编程入门(二十)——RNN LSTM 数学原理与结构拆解

LSTM 的"传送带"直觉有了,但门到底怎么算?本文逐一拆解遗忘门、输入门、输出门的完整计算公式,推导 7 个核心公式,讲清 sigmoid(阀门)和 tanh(载体)的分工逻辑,统计参数量(约为 RNN 的 4 倍),并手写 lstm_forward 代码打印每一步张量形状——把 LSTM 从"比喻"落到"代码"。

文章图片
#深度学习
python神经网络编程入门(十八)——RNN BPTT算法(下):代码实现与梯度裁剪

第十七篇在纸上推完了 BPTT 公式,这篇把它们变成能跑的代码:手写 rnn_backward,倒序遍历时间轴翻译 δ_t 递推式;用数值梯度(中心差分)给全部参数做体检,误差 1e-8 量级;再给梯度装"限速器"——不裁剪时 loss 40 步冲到 1e91 直接 NaN,裁剪后 300 步从 3.72 降到 0.06;最后封装成 RNNLayer 类。附完整代码、体检报告与对比曲线。

文章图片
#深度学习
python神经网络编程入门(四)----神经网络误差反向传播完全图解

本文介绍了神经网络中误差反向传播的原理与矩阵实现方法。核心要点包括:1)误差按权重比例反向分配原则,通过权重转置矩阵实现多层误差传递;2)从单节点到多节点的误差分配过程,隐藏层误差为所有输出链接误差之和;3)利用矩阵乘法将复杂计算简化为W^T×E的运算;4)通过2×2网络实例演示了从输出层到隐藏层再到输入层的完整误差反向传播流程。文章强调矩阵运算的高效性,并提供Python代码实现手工循环和矩阵两

文章图片
#算法#人工智能#深度学习 +1
python神经网络编程入门(十二)——CNN池化层(Pooling)—— 为什么要“压缩“图像?

本文解析池化层在CNN中的核心作用与实现原理。首先指出卷积层特征图尺寸不变导致计算量剧增的问题,引入池化层作为解决方案,阐述其降维、增强平移不变性和防过拟合三大功能,对比最大池化(提取显著特征)与平均池化(平滑处理)的差异。通过4×4矩阵逐步手算演示前向传播,重点讲解反向传播梯度分配机制:最大池化由最大值位置独享梯度,平均池化则均分梯度。最后用NumPy完整实现MaxPooling的前向传播(需记

文章图片
#深度学习#神经网络#cnn +4
python神经网络编程入门(十六)——从零实现RNN前向传播:把公式变成能跑的函数

第2章把公式拆到骨头里,这一章把它变成能跑的函数!纯 NumPy 手写 RNN 前向传播:从单时间步函数到完整 rnn_forward,逐行拆解时间循环、维度切片与 cache 缓存。附小模型手算对照、Seq=1 退化成全连接实验、输出维度与推演表逐位验证、四大常见坑与 FAQ。跑一遍 rnn_forward.py,你也能徒手写出 RNN 前向传播!

文章图片
#rnn#numpy#深度学习 +2
python神经网络编程入门(二十七)——RNN IMBD搭建情感分类器与基础训练

数据备齐了,这一章开火:把 `Embedding → GRU → Linear(1) → Sigmoid` 三层拼成情感分类器,让模型拿影评"读一遍、打个分"。先用 200 条小样本验证代码没写错(损失前十轮内从 0.70 掉到 0.08,直接背下全部样本),再在 8000 条上正式训练 25 轮:训练损失从 0.694 一路降到 0.054,验证准确率从 50% 爬到 73.85%;第 21 轮

文章图片
#深度学习
python神经网络编程入门(二十一)——从零实现 LSTM 前后向传播

写完前向就该写反向。LSTM 反向传播的核心是梯度沿 ct和 ht 两条路径分流汇聚——ct路径只有逐元素乘法,梯度几乎不衰减,这是 LSTM 能记住长期依赖的根本原因。本文手推完整 11 步反向公式,提供带维度标注的 NumPy 实现,用数值梯度做全身体检,最后在序列复制任务上对比 RNN 与 LSTM——同样隐层大小,LSTM 迅速收敛,RNN 原地踏步。代码与数学一一对应,一步到位。

文章图片
python神经网络编程入门(九)——CNN卷积核到底在“卷”什么?—— 局部感受野、权值共享与平移不变性?

本文深入浅出地解析了卷积神经网络(CNN)如何解决全连接网络(MLP)处理图像时的三大缺陷:参数爆炸、空间结构破坏和平移不变性缺失。通过局部感受野、权值共享和池化三大核心技术,CNN实现了:1)每次只处理图像局部区域,大幅减少参数量;2)相同卷积核扫描全图,高效提取位置无关特征;3)池化操作增强平移鲁棒性。这些设计使CNN成为图像处理的理想架构,既保留了空间结构,又具备参数高效性。文章最后预告将通

文章图片
#深度学习#人工智能#python +2
    共 30 条
  • 1
  • 2
  • 3
  • 请选择