学习笔记
我总结的基本概念https://blog.csdn.net/chloe2333/article/details/158805007?sharetype=blogdetail&sharerId=158805007&sharerefer=PC&sharesource=chloe2333&spm=1011.2480.3001.8118

1.第一节
https://blog.csdn.net/JiduoW/article/details/125980929?ops_request_misc=%257B%2522request%255Fid%2522%253A%25222c3d920438c07a646d7e1aebfedad9b2%2522%252C%2522scm%2522%253A%252220140713.130102334…%2522%257D&request_id=2c3d920438c07a646d7e1aebfedad9b2&biz_id=0&utm_medium=distribute.pc_search_result.none-task-blog-2alltop_positive~default-1-125980929-null-null.142v102pc_search_result_base1&utm_term=%E6%9D%8E%E5%AE%8F%E6%AF%85%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0&spm=1018.2226.3001.4187
或者
https://blog.csdn.net/weixin_52836217/article/details/128463468?spm=1001.2014.3001.5502

  1. 第二节
    https://blog.csdn.net/weixin_52836217/article/details/128485466?ops_request_misc=%257B%2522request%255Fid%2522%253A%25224d7592756daffaa956095717893a4a55%2522%252C%2522scm%2522%253A%252220140713.130102334…%2522%257D&request_id=4d7592756daffaa956095717893a4a55&biz_id=0&utm_medium=distribute.pc_search_result.none-task-blog-2allsobaiduend~default-4-128485466-null-null.142v102pc_search_result_base1&utm_term=%E6%9D%8E%E5%AE%8F%E6%AF%852021%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0&spm=1018.2226.3001.4187

3、第三节 CNN图像识别及self attention自注意力机制
https://blog.csdn.net/weixin_52836217/article/details/128485743?spm=1001.2101.3001.6650.5&utm_medium=distribute.pc_relevant.none-task-blog-2%7Edefault%7EBlogCommendFromBaidu%7ERate-5-128485743-blog-128485466.235%5Ev43%5Econtrol&depth_1-utm_source=distribute.pc_relevant.none-task-blog-2%7Edefault%7EBlogCommendFromBaidu%7ERate-5-128485743-blog-128485466.235%5Ev43%5Econtrol&utm_relevant_index=5

4、transformer
https://blog.csdn.net/weixin_52836217/article/details/128494330?spm=1001.2014.3001.5502

根据你之前对点积(dot product)的兴趣,我将李宏毅机器学习课程中涉及的类似核心数学概念,按照课程主线为你系统地梳理和总结如下。这些概念构成了理解机器学习,特别是深度学习的基础。

机器学习基础概念

这部分是课程的入门内容,定义了机器学习要解决的主要问题类型。

中文术语英文术语简单解释
回归Regression机器的任务是找到一个函数,输出一个连续的数值(scalar)。比如预测明天的PM2.5数值、房价等。
分类Classification机器的任务是找到一个函数,输出一个离散的类别(class)。比如判断邮件是否为垃圾邮件、图片中是猫还是狗。
结构化学习Structured Learning机器的任务是创造出有结构的复杂东西,输出是一个带有结构的物件,如一张图片、一段文字(句子)。

模型训练三步曲

这是李宏毅老师课程中反复强调的机器学习核心流程,涉及大量基础术语。

中文术语英文术语简单解释
模型Model带有未知参数的函数。例如线性模型 ( y = wx + b ) 。
特征Feature模型的输入,用于预测的一些已知数据。例如预测明日观看人数时,就用前一天的观看人数作为特征 ( x_1 ) 。
权重Weight模型中的参数,用符号 ( w ) 表示,表示输入特征对输出结果的影响程度。
偏置Bias模型中的参数,用符号 ( b ) 表示,可以理解为函数本身的偏移量。
标签Label训练数据中给出的正确答案,通常用 ( \hat{y} ) 或 ( y^* ) 表示。
损失函数Loss Function用来衡量一组参数(如 ( w, b ))好坏程度的函数。损失越大,说明当前模型的预测结果越差。常见的损失函数有平均绝对误差(MAE)均方误差(MSE)
误差曲面Error Surface以模型参数为坐标,绘制出的损失函数值所形成的曲面。梯度下降就是在该曲面上寻找最低点。
梯度下降Gradient Descent一种优化方法,通过计算损失函数对参数的梯度(微分),并沿着梯度的反方向更新参数,以此来逐步减小损失函数的值,找到最优参数。
学习率Learning Rate梯度下降过程中的一个超参数(需要自己设置),决定了参数每次更新的步长。学习率太大可能跳过最优点,太小则训练速度过慢。
超参数Hyperparameter在机器学习中,需要人为设定,而不是由机器从数据中学习出来的参数。例如学习率、batch size、模型层数等。

误差分析与模型评估

这部分帮助你理解模型为什么好或不好,以及如何改进。

中文术语英文术语简单解释
偏差Bias描述模型的期望预测真实值之间的差距。偏差大通常意味着模型欠拟合,没有很好地捕捉数据特征。
方差Variance描述模型在不同训练集上预测结果的波动程度。方差大通常意味着模型过拟合,对训练数据中的噪声过于敏感。
过拟合Overfitting模型在训练集上表现很好,但在测试集(未见过的数据)上表现很差。通常是因为模型过于复杂,把训练数据中的噪声也学习进去了。
欠拟合Underfitting模型即使在训练集上也表现不佳。通常是因为模型过于简单,无法捕捉数据的基本模式。
正则化Regularization一种用来缓解过拟合的技术。通过在损失函数上添加一个惩罚项(与模型参数大小有关),来限制模型的复杂度,防止它过分拟合训练数据。

进阶模型与神经网络核心概念

当线性模型不够用时,课程引入了更强大的神经网络,这些是关键概念。

中文术语英文术语简单解释
激活函数Activation Function在神经网络中,将上层的线性输出进行非线性变换的函数,使网络有能力学习复杂的模式。常见的激活函数有 SigmoidReLU 等。
Sigmoid函数Sigmoid Function一种经典的激活函数,可以将任意输入压缩到0到1之间,形状像字母S,常用于拟合平滑的"折线"。
线性整流单元ReLU (Rectified Linear Unit)一种更常用的激活函数,计算简单(取输入和0的最大值),能有效缓解梯度消失问题。它可以用来组合出更复杂的函数(如Hard Sigmoid)。
神经网络Neural Network由许多神经元(即激活函数)组成的网络结构。在课程中,将许多Sigmoid或ReLU函数叠加起来就构成了神经网络。
深度学习Deep Learning指具有很多隐藏层的神经网络。课程中通过实验证明,深而窄的网络往往比浅而胖的网络效果更好。
批处理Batch在训练神经网络时,不会一次性把所有数据都拿来计算梯度,而是将数据随机分成多个小批次,每次用一个批次的数据来更新一次参数。
迭代/更新Update模型参数每使用一个batch的数据进行一次梯度下降,就是一次更新。
回合Epoch将训练集中的所有batch都看过一遍,并使模型参数更新了相应次数,这个过程称为一个回合。

优化算法

除了基础的梯度下降,课程中还介绍了一些更高级的优化技巧。

中文术语英文术语简单解释
反向传播Backpropagation一种在神经网络中高效计算梯度的算法。它利用微积分中的链式法则,从输出层向输入层反向传播误差,从而计算出损失函数对网络中每个参数的梯度。
自适应梯度算法Adagrad一种梯度下降的变体,它的核心思想是让学习率能够自适应地调整。对于出现频率高的参数,采用较小的学习率;对于出现频率低的参数,采用较大的学习率。
随机梯度下降SGD (Stochastic Gradient Descent)另一种梯度下降的变体,它每次只随机选取一个样本来计算梯度并更新参数。这样可以加快训练速度,但更新过程会有较大的震荡。

你提的这两个概念非常重要,它们是理解模型内部计算(比如神经网络如何从输入得到输出)的基础。上次的总结主要集中在模型训练和评估的高层概念上,这次我们把镜头拉近,聚焦在向量和矩阵的具体运算上。

结合李宏毅老师的课程内容(特别是深度学习部分的基础数学原理),以下是补充的数学概念:

核心向量与矩阵运算

中文术语英文术语简单解释在课程中的应用
向量Vector一组有序的数字,通常表示为一个列或行。可以看作是空间中的一个点或一个方向。在机器学习中,输入特征(如一张图片的像素值)、模型的中间层输出、词嵌入(Word Embedding)都被表示为向量。
矩阵Matrix一个由数字组成的二维表格。可以看作是多个向量排列在一起。神经网络的权重(Weights) 通常以矩阵的形式存在,用于对输入向量进行线性变换。
张量Tensor向量和矩阵的推广。标量是0阶张量,向量是1阶张量,矩阵是2阶张量,而像彩色图片(高、宽、RGB通道)这样的数据就可以表示为3阶张量。在深度学习框架(如PyTorch、TensorFlow)中,所有数据(输入、输出、中间结果)的基本数据类型都是张量。
转置Transpose将矩阵的行和列互换的操作。对于一个矩阵 ( \mathbf{A} ),其转置记作 ( \mathbf{A}^{\mathsf{T}} ) 或 ( \mathbf{A}’ )。转置经常出现在公式推导中,例如为了满足矩阵乘法的维度匹配条件,或者计算向量的內积(将列向量转置为行向量后相乘)。
內积Inner Product这是点积(Dot Product) 的更一般的数学称呼。在欧几里得空间中,它就是对应元素相乘后求和。神经网络中神经元的核心计算就是“加权和”,即输入向量与权重向量的內积,再加上偏置。
外积Outer Product给定两个向量,外积运算的结果是一个矩阵。例如,( m ) 维向量 ( \mathbf{u} ) 和 ( n ) 维向量 ( \mathbf{v} ) 的外积 ( \mathbf{u} \mathbf{v}^{\mathsf{T}} ) 得到一个 ( m \times n ) 的矩阵。在某些梯度更新规则或矩阵分解算法中会涉及。
矩阵乘法Matrix Multiplication两个矩阵 ( \mathbf{A} ) 和 ( \mathbf{B} ) 相乘,得到新矩阵 ( \mathbf{C} )。( \mathbf{C} ) 中第 ( i ) 行第 ( j ) 列的元素,等于 ( \mathbf{A} ) 的第 ( i ) 行向量与 ( \mathbf{B} ) 的第 ( j ) 列向量的內积。这是神经网络前向传播(Forward Propagation) 的核心操作,即 ( \text{output} = \text{activation}(\text{input} \times \text{weight} + \text{bias}) )。
哈达玛积Hadamard Product两个同型矩阵(形状相同)之间的一种乘法,结果矩阵的每个元素是输入矩阵对应位置元素的乘积。记作 ( \mathbf{A} \odot \mathbf{B} )。在一些特定的网络结构(如注意力机制)或元素级的梯度更新中会出现。
范数Norm衡量向量或矩阵“长度”或“大小”的函数。L2范数(L2-norm):即向量到原点的欧几里得距离,常被用作正则化(Regularization) 项,防止过拟合。
L1范数(L1-norm):向量各元素绝对值之和,可以鼓励产生稀疏的权重。
Trace矩阵对角线元素之和,记作 ( \mathrm{tr}(\mathbf{A}) )。在一些高级的矩阵微分和损失函数推导中会遇到。
行列式Determinant一个可以从方阵计算出来的标量值,描述了矩阵作为线性变换对空间的缩放比例。在流形学习或一些概率生成模型中会涉及。
逆矩阵Inverse Matrix对于一个 ( n \times n ) 的方阵 ( \mathbf{A} ),如果存在另一个方阵 ( \mathbf{A}^{-1} ),使得 ( \mathbf{A} \mathbf{A}^{-1} = \mathbf{I}_n )(单位矩阵),则 ( \mathbf{A}^{-1} ) 是 ( \mathbf{A} ) 的逆矩阵。在某些线性模型的解析解(closed-form solution)求解中需要用到。

总结与关联

这些运算共同构成了机器学习的“数学语法”:

  • 內积(点积) 定义了“相似度”和“线性组合”的基本操作。在这里插入图片描述

  • 转置 是调整数据维度、连接不同公式的桥梁。

  • 矩阵乘法 是实现多层神经网络并行计算的高效方式。

  • 范数 则用来约束模型,让它变得更“简单”或“平滑”。

希望这份补充能帮你填补上这块基础拼图。如果对其中某个运算(比如矩阵乘法为什么能用来做神经网络的并行计算)有进一步疑问,随时可以再问。

更多推荐