8.1 神经元的基本结构:线性和,激活函数(你写的 “激光函数” 应该是笔误)

8.1.1 什么是神经元?

神经元是神经网络的最小单元,模拟的是生物大脑中神经细胞的工作方式:接收输入信号,处理后输出信号。

8.1.2 核心组成:线性和 + 激活函数
(1)线性和(加权求和)

假设一个神经元接收 3 个输入 x1​,x2​,x3​,每个输入都有对应的权重 w1​,w2​,w3​(可以理解为 “输入信号的重要程度”),还有一个偏置项 b(可以理解为 “神经元的基础活跃度”)。线性和的计算公式:z=x1​w1​+x2​w2​+x3​w3​+b

  • 专业名词解释:
    • 权重(w):衡量每个输入对输出的影响大小,比如 w1​ 越大,x1​ 对最终结果的影响越强。
    • 偏置(b):调整神经元的输出基线,避免输入全为 0 时输出也为 0,让模型更灵活。
(2)激活函数(你笔误的 “激光函数”)

线性和的结果 z 是 “线性的”(比如输入翻倍,输出也翻倍),但现实世界的问题大多是 “非线性的”(比如 “成绩是否及格” 不是线性的)。激活函数的作用就是给神经元加入非线性能力,让神经网络能拟合复杂的问题。

常见的激活函数:

  • Sigmoid:把输出压缩到 0~1 之间,适合二分类问题(比如 “是 / 否”)。σ(z)=1+e−z1​
  • ReLU:最简单且常用,ReLU(z)=max(0,z),只保留正数,负数直接置 0,计算快。
  • Tanh:把输出压缩到 -1~1 之间,比 Sigmoid 更对称。

神经元的完整计算流程:输入 → 加权求和(线性和)→ 激活函数 → 输出

8.2 全连接前馈神经网络(BP 神经网络 / 多层感知机)

8.2.1 核心概念解释
(1)全连接(Fully Connected)

“全连接” 指的是:相邻两层的所有神经元之间都有连接。比如:输入层有 3 个神经元,隐藏层有 2 个神经元,那么输入层的每个神经元都和隐藏层的每个神经元相连(总共 3×2=6 条连接)。

  • 直观理解:就像全班同学两两之间都有联系方式,没有任何一对是断开的。
(2)前馈(Feedforward)

“前馈” 指的是:数据只能从输入层→隐藏层→输出层单向流动,没有反向或循环的连接。

  • 直观理解:就像水流只能顺着水管往前流,不能倒流,也不能绕圈。
8.2.2 网络结构

典型的全连接前馈网络分为三层:

  1. 输入层:接收原始数据(比如手写数字识别中,输入是 28×28=784 个像素值);
  2. 隐藏层:介于输入层和输出层之间,负责提取特征(可以有多层隐藏层);
  3. 输出层:输出最终结果(比如手写数字识别中,输出是 0~9 共 10 个类别)。
8.2.3 前向计算(核心流程)

“前向计算” 就是数据从输入层到输出层的计算过程,步骤如下:假设网络结构:输入层(2 个神经元)→ 隐藏层(2 个神经元)→ 输出层(1 个神经元)。

步骤 1:输入层→隐藏层
  • 输入层:x1​,x2​
  • 隐藏层神经元 1 的线性和:zh1​=x1​w11​+x2​w21​+bh1​
  • 隐藏层神经元 1 的输出:ah1​=ReLU(zh1​)
  • 隐藏层神经元 2 的线性和:zh2​=x1​w12​+x2​w22​+bh2​
  • 隐藏层神经元 2 的输出:ah2​=ReLU(zh2​)
步骤 2:隐藏层→输出层
  • 输出层神经元的线性和:zo​=ah1​wh1o​+ah2​wh2o​+bo​
  • 输出层输出:ao​=Sigmoid(zo​)(比如二分类问题)
补充:BP 神经网络

“BP” 是 “反向传播(Back Propagation)” 的缩写,其实是全连接网络的训练方法(不是结构):前向计算得到输出后,计算预测值和真实值的误差,再把误差从输出层反向传播到输入层,更新所有权重和偏置,让误差越来越小。

8.3 卷积神经网络(CNN)

卷积神经网络专门解决 “网格状数据” 的问题(比如图片是 2D 网格,语音是 1D 网格),核心是卷积层和池化层,LeNet5 是最早的 CNN 模型(用于手写数字识别)。

8.3.1 LeNet5 模型结构(经典入门结构)

LeNet5 的完整结构(输入到输出):输入(32×32 灰度图)→ 卷积层 C1 → 池化层 S2 → 卷积层 C3 → 池化层 S4 → 全连接层 C5 → 全连接层 F6 → 输出层(10 类)

8.3.2 卷积(Convolution)
(1)核心概念:卷积核(Filter/Kernel)

卷积核是一个小矩阵(比如 3×3、5×5),是卷积的 “核心工具”。

  • 直观理解:卷积核就像一个 “放大镜”,在图片上滑动,提取局部特征(比如边缘、纹理)。
(2)卷积的前向算法(计算过程)

步骤:

  1. 把卷积核放在输入图片的左上角;
  2. 卷积核的每个元素和图片对应位置的像素值相乘,然后求和(得到一个值);
  3. 把卷积核向右 / 向下滑动(滑动步长 Stride,比如步长 1 就是每次滑 1 个像素);
  4. 重复步骤 2,直到卷积核滑过整张图片,最终得到一个 “特征图(Feature Map)”。

举个简单例子:输入图片(4×4):

plaintext

1 2 3 4
5 6 7 8
9 10 11 12
13 14 15 16

卷积核(2×2):

plaintext

1 0
0 1

步长 = 1,卷积计算:

  • 左上角:1×1 + 2×0 + 5×0 + 6×1 = 7
  • 向右滑 1 步:2×1 + 3×0 + 6×0 + 7×1 = 9
  • 继续滑动,最终得到 3×3 的特征图。
(3)卷积的核心设计:局部连接 + 权值共享
  • 局部连接:卷积核只关注图片的局部区域(比如 3×3 卷积核只看 9 个像素),而不是全连接那样看整张图。→ 原因:图片的特征是局部的(比如眼睛只在人脸的局部位置),不需要全局连接,能大幅减少参数。
  • 权值共享:同一个卷积核在滑动过程中,权重值不变(比如上面的 2×2 卷积核,滑到任何位置都是 [1,0;0,1])。→ 原因:图片的同一类特征(比如边缘)可能出现在图片的任何位置,共享权重能减少参数,避免过拟合。
(4)卷积的作用

提取图片的局部特征(比如边缘、纹理、形状),低层卷积提取简单特征(边缘),高层卷积提取复杂特征(人脸、物体)。

8.3.3 池化(Pooling)

池化是 “下采样” 操作,紧跟在卷积层之后,目的是压缩特征图的尺寸(减少参数),同时保留关键特征。

(1)池化的前向算法(常见类型:最大池化 Max Pooling)

步骤:

  1. 用一个池化窗口(比如 2×2)放在特征图的左上角;
  2. 取窗口内的最大值(最大池化);
  3. 滑动窗口(步长通常 = 窗口大小,比如 2×2 窗口步长 2);
  4. 重复步骤 2,得到缩小后的特征图。

例子:特征图(4×4):

plaintext

7 9 11 13
8 10 12 14
15 17 19 21
16 18 20 22

2×2 最大池化,步长 = 2:

  • 左上角窗口最大值:10
  • 右上角窗口最大值:14
  • 左下角窗口最大值:18
  • 右下角窗口最大值:22最终得到 2×2 的池化结果。
(2)池化的作用
  1. 降维:减少特征图的尺寸和参数数量,加快计算,避免过拟合;
  2. 特征不变性:比如图片轻微平移,池化后仍能保留关键特征(比如物体的形状)。

8.4 RNN 模型(循环神经网络)

CNN 处理 “静态数据”(比如单张图片),而 RNN 专门处理 “序列数据”(比如文字、语音、时间序列)。

8.4.1 RNN 的结构

RNN 的核心是 “循环”:隐藏层的输出不仅传给输出层,还会反馈给自己,作为下一个时间步的输入。

(1)核心结构(时间步展开)

假设处理一句话(每个字是一个时间步):

  • 时间步 t=1:输入 x1​ → 隐藏层 h1​=f(x1​,h0​)(h0​ 是初始隐藏状态,通常为 0)→ 输出 y1​
  • 时间步 t=2:输入 x2​ → 隐藏层 h2​=f(x2​,h1​) → 输出 y2​
  • 时间步 t=3:输入 x3​ → 隐藏层 h3​=f(x3​,h2​) → 输出 y3​

核心公式:ht​=tanh(Wxh​xt​+Whh​ht−1​+bh​)yt​=Why​ht​+by​

  • 专业名词:
    • 时间步(Time Step):序列数据的每个元素(比如一句话的每个字)对应一个时间步;
    • 隐藏状态(ht​):保存了当前时间步和之前所有时间步的信息,是 RNN 的 “记忆”。
8.4.2 RNN 的应用场景
  1. 自然语言处理:文本生成、机器翻译、情感分析、语音识别;
  2. 时间序列预测:股票价格预测、气温预测、销量预测;
  3. 视频分析:视频帧的连续分析(比如动作识别)。
8.4.3 RNN 的后续模型(解决 RNN 的缺陷)

原始 RNN 有 “梯度消失 / 爆炸” 问题:处理长序列时,早期时间步的信息会丢失(比如一句话的开头忘了)。后续模型解决了这个问题:

(1)LSTM(长短期记忆网络)
  • 核心改进:加入 “门控机制”(输入门、遗忘门、输出门),可以控制 “记忆” 的保留和遗忘,能记住长序列的早期信息。
  • 应用:机器翻译、文本摘要、语音识别(目前仍广泛使用)。
(2)GRU(门控循环单元)
  • 简化版 LSTM:把输入门和遗忘门合并为 “更新门”,参数更少,计算更快,效果接近 LSTM。
(3)Transformer
  • 核心改进:抛弃 RNN 的 “顺序计算”(按时间步一步步算),改用 “自注意力机制”(Self-Attention),可以并行计算所有时间步,速度大幅提升。
  • 应用:ChatGPT、BERT 等大语言模型的核心结构,是目前 NLP 领域的主流。

总结

  1. 基础核心:神经元的本质是 “线性和 + 激活函数”,激活函数赋予神经网络非线性能力;
  2. 全连接网络:相邻层神经元全连接、数据单向前馈,是最基础的神经网络,适合简单数据;
  3. 卷积网络:核心是卷积(局部连接 + 权值共享,提取局部特征)和池化(降维保特征),适合图片等网格数据,LeNet5 是经典入门模型;
  4. 循环网络:通过隐藏状态保存序列信息,适合文字 / 时间序列等数据,LSTM 解决了原始 RNN 的长序列记忆问题,Transformer 是目前的主流升级版本。

更多推荐