机器学习这门学科,源于不同的领域,因此,相同的概念可能会有不同的术语,如,slope ↔ weight、intercept ↔ bias

本文收集了一些机器学习中的这类表达,共大家参考。

一、等价的概念

1. 线性部分

统计学 / 线性回归深度学习工程说明
slope(斜率)weight(权重 www变量相乘的系数
intercept(截距)bias(偏置 bbb常数偏移项

2. 损失、目标函数类

统计学深度学习工程说明
loss functioncost function绝大多数场景完全等价; 严格细分:loss 单样本损失,cost 全部样本平均损失,但很多文献混用
negative log likelihood(NLL,负对数似然)cross entropy(交叉熵)分类任务:二者数学表达式一样,出发点不同。 统计:从概率极大似然推导;DL:直接当作分类损失
residual(残差)prediction error(预测误差)真值 − 预测值 y−y^y-\hat yyy^

3. 模型参数相关

统计学深度学习工程说明
coefficient(系数)weight / kernel广义,回归里叫系数,CNN中卷积参数叫kernel
latent variable(隐变量)hidden state / embedding不可直接观测的变量; 统计:latent variable;DL:隐状态、嵌入向量
fitted value(拟合值)model prediction(模型预测值)模型输出 y^\hat yy^

4. 网络层与运算

统计学深度学习工程说明
basis function(基函数)activation function(激活函数)ReLU可以看成一组基,统计视角叫基函数,DL叫激活
affine transformation(仿射变换)linear layer(线性层 / Dense层)z=Wx+bz = Wx+bz=Wx+b,完全相同计算

5. 数据集 & 估计相关

统计学深度学习工程说明
explanatory variable / predictorfeature / input输入特征 xxx
response variable / dependent variabletarget / label要预测的标签 yyy
independent variablefeature自变量,也就是特征
maximum likelihood estimation(MLE)maximum likelihood training极大似然估计;DL分类训练本质就是MLE
empirical risktraining loss经验风险 = 在训练集上算的损失

6. 优化相关

统计学深度学习工程说明
gradient descent(梯度下降)gradient descent名字没变,但侧重点不同: 统计:用来求参数估计;DL:网络权重更新
regularization(正则化)weight decay(权重衰减)L2正则,统计叫regularization,工程中L2常直接叫weight decay(注意二者不完全等价,Adam下有细微差别)

二、看似等价,但不完全等同的术语

1. L2 Regularization(L2正则) vs Weight Decay(权重衰减)

粗略说法:二者经常被当成一回事

  • L2正则:在损失函数上加项 λ2∥w∥2\frac{\lambda}{2}\|w\|^22λw2
  • Weight decay:参数更新时,直接对权重乘以 (1−λ)(1-\lambda)(1λ)

核心差别(Adam 这类自适应优化器下明显)

  1. SGD:L2正则 ≈ weight decay,效果几乎一样,可以混用叫法。
  2. Adam / AdamW:
    • 普通L2正则:把λw\lambda wλw加到梯度里,会被自适应学习率缩放,不是真正的权重衰减
    • AdamW:直接在参数更新阶段做权重衰减,才是严格意义weight decay

✅总结:Adam下L2正则 ≠ weight decay,只有AdamW才实现真正weight decay。论文里提weight decay,默认优先指AdamW的实现。

2. Cross Entropy(交叉熵) vs Negative Log-Likelihood(NLL,负对数似然)

多分类场景,很多人直接划等号,但依赖网络输出层:

  1. 网络输出经过 Softmax:CrossEntropyLoss = Softmax + NLL。
    • PyTorch nn.CrossEntropyLoss:内部自带Softmax。输入是logits,不能提前softmax。
  2. 网络输出已经是概率(已经Softmax):此时损失就是单纯 NLL。
    • PyTorch nn.NLLLoss不带Softmax,要求输入log-prob(log(softmax))。

坑点:
如果你把softmax后的概率喂给CrossEntropyLoss,模型训练直接出问题。
数学上:交叉熵损失 = 对logits做softmax之后的负对数似然,两者不是无条件等同。

3. Loss Function vs Cost Function

  • Loss:单个样本的损失值
  • Cost:整个训练集上loss的均值/总和
    很多教材、博客随手混用。
    坑:写公式时,有的作者cost定义为总和,有的是均值;调参时要看清楚公式定义,不然学习率需要对应缩放。

4. Basis function(基函数) vs Activation function(激活函数)

《Understanding Deep Learning》会把ReLU叫做basis function。

  • 统计视角:ReLU构造一组基,把输入映射到新空间(basis function)
  • DL工程视角:只是对线性输出做非线性变换(activation function)
    ⚠️不是所有激活函数都叫基函数。只有把隐层单元看作基的那套统计解释才这么称呼;sigmoid/tanh一般不会被叫做基函数。只是特定视角下的类比,不是通用等价定义。

5. Latent variable(隐变量) vs Embedding

  • Latent variable:统计学概念,无法直接观测的变量;来源是概率模型(VAE、概率图模型)。
  • Embedding:工程名词,低维稠密向量,可以是可学习参数,不一定有概率解释。
    坑:所有embedding都可以叫latent variable吗?不。
    普通推荐模型的user embedding,只是特征向量,不一定具备概率隐变量含义,只是大家习惯混用。

6. Affine transformation(仿射变换) vs Linear layer(Dense/全连接层)

仿射变换:Wx+bWx + bWx+b

  • Linear变换严格定义:WxWxWx(无偏置,必须过原点)
  • Affine = 线性变换 + 平移(+b)

坑:
深度学习里叫Linear层(Pytorch nn.Linear),它自带bias,本质是仿射变换。名字叫Linear,但数学上不是纯线性。
这是命名上最大陷阱之一!
数学:Linear ≠ Affine
工程:nn.Linear 是 Affine transformation。

更多推荐