
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
上一章我们把编码器(Encoder)内部的"残差、LayerNorm、前馈"三块承重墙拆了个底朝天;这一章轮到另一半——解码器(Decoder)。解码器比编码器多两样东西:一张**"不许偷看未来"的掩码**,和一种**"去查编码器记忆"的交叉注意力**。文章先把这两样东西的来龙去脉讲透:为什么生成第 t 个词时不能看第 t+1 个词?那张"上三角遮罩"到底长什么样、为什么必须填 -1e9 而不是

YOLOv10 训练实操全记录:从清华官方权重微调 2 类跌倒检测数据集,20 epochs 仅约 9 分钟,mAP50 达 0.920,少样本 fall 类 0.928。端到端无 NMS 架构,推理后处理仅 0.1ms。手把手排掉 3 个坑:torch 2.6 权重加载失败(weights_only)、numpy 2.x trapz 移除、续训文件名自动切换崩溃。全部数字来自真实运行,附损失曲线

YOLOv8 训练实操教程:Ultralytics 统一 API 起点,Anchor-Free + DFL 分布回归将同配置 mAP50 从 0.46 提升到 0.68。深度拆解 C2f 梯度流、DFL 16-bin 期望回归、Task-Aligned 标签分配与解耦头设计,pip 一键安装,检测/分割/分类/姿态统一调用。

大模型的Function Calling不神秘:模型只会编码文本,框架负责执行。本文用NumPy从零实现工具调用闭环——模型输出特殊Token→解析→执行函数→结果拼回上下文,全程可运行、可复现,不依赖任何LLM与API。附完整源码、真实运行证据与6张即截即用的图解,从黑盒到白盒,一篇彻底看懂Agent工具调用。

从这一章起进入"预训练篇":我们要理解 BERT、GPT 真实大模型,而大模型吃的第一口饭是数字。这一章解决"文字怎么变成数字":为什么不能用整词(词表爆炸+OOV),也不能用单字符(序列太长)?什么是 BPE 子词切分?它如何从语料里一步步合并出子词,让新词永不 OOV、还能无损还原?全章用纯 Python 手写八个示例:三种切分对比、BPE 训练(经典语料逐轮打印合并规则)、编码、解码、中文语

这篇文章介绍了一个从零开始实现神经网络的Python教程专栏。专栏特色是仅使用NumPy而不依赖任何深度学习框架,帮助读者深入理解前向传播、反向传播等核心算法的数学原理。目前已发布7篇文章,从基础分类器到MNIST手写数字识别逐步深入。后续还将更新激活函数选择、梯度消失/爆炸问题以及各种优化器等内容。专栏所有代码开源,读者可通过关注、收藏获取最新更新。文章提供了详细的学习路线图和获取方式说明。

第 9 章我们把 Transformer 这台"发动机"装好并通过了全部自检——但就像新电脑没有操作系统,机器只会"均匀地说废话"。这一章装操作系统,而且一装就是三件套:**标签平滑(Label Smoothing)**、**AdamW 优化器**、**warmup 学习率调度**。文章不满足于"记住三个名词",而是把每一件都拆到数学和数字里:标签平滑为什么能把"最优 logits 从 +∞ 拽回

LSTM 的"传送带"直觉有了,但门到底怎么算?本文逐一拆解遗忘门、输入门、输出门的完整计算公式,推导 7 个核心公式,讲清 sigmoid(阀门)和 tanh(载体)的分工逻辑,统计参数量(约为 RNN 的 4 倍),并手写 lstm_forward 代码打印每一步张量形状——把 LSTM 从"比喻"落到"代码"。

第十七篇在纸上推完了 BPTT 公式,这篇把它们变成能跑的代码:手写 rnn_backward,倒序遍历时间轴翻译 δ_t 递推式;用数值梯度(中心差分)给全部参数做体检,误差 1e-8 量级;再给梯度装"限速器"——不裁剪时 loss 40 步冲到 1e91 直接 NaN,裁剪后 300 步从 3.72 降到 0.06;最后封装成 RNNLayer 类。附完整代码、体检报告与对比曲线。

本文介绍了神经网络中误差反向传播的原理与矩阵实现方法。核心要点包括:1)误差按权重比例反向分配原则,通过权重转置矩阵实现多层误差传递;2)从单节点到多节点的误差分配过程,隐藏层误差为所有输出链接误差之和;3)利用矩阵乘法将复杂计算简化为W^T×E的运算;4)通过2×2网络实例演示了从输出层到隐藏层再到输入层的完整误差反向传播流程。文章强调矩阵运算的高效性,并提供Python代码实现手工循环和矩阵两








