机器学习中,相同的概念的不同术语表达,如,slope ↔ weight、intercept ↔ bias
·
机器学习这门学科,源于不同的领域,因此,相同的概念可能会有不同的术语,如,slope ↔ weight、intercept ↔ bias
本文收集了一些机器学习中的这类表达,共大家参考。
一、等价的概念
1. 线性部分
| 统计学 / 线性回归 | 深度学习工程 | 说明 |
|---|---|---|
| slope(斜率) | weight(权重 www) | 变量相乘的系数 |
| intercept(截距) | bias(偏置 bbb) | 常数偏移项 |
2. 损失、目标函数类
| 统计学 | 深度学习工程 | 说明 |
|---|---|---|
| loss function | cost function | 绝大多数场景完全等价; 严格细分:loss 单样本损失,cost 全部样本平均损失,但很多文献混用 |
| negative log likelihood(NLL,负对数似然) | cross entropy(交叉熵) | 分类任务:二者数学表达式一样,出发点不同。 统计:从概率极大似然推导;DL:直接当作分类损失 |
| residual(残差) | prediction error(预测误差) | 真值 − 预测值 y−y^y-\hat yy−y^ |
3. 模型参数相关
| 统计学 | 深度学习工程 | 说明 |
|---|---|---|
| coefficient(系数) | weight / kernel | 广义,回归里叫系数,CNN中卷积参数叫kernel |
| latent variable(隐变量) | hidden state / embedding | 不可直接观测的变量; 统计:latent variable;DL:隐状态、嵌入向量 |
| fitted value(拟合值) | model prediction(模型预测值) | 模型输出 y^\hat yy^ |
4. 网络层与运算
| 统计学 | 深度学习工程 | 说明 |
|---|---|---|
| basis function(基函数) | activation function(激活函数) | ReLU可以看成一组基,统计视角叫基函数,DL叫激活 |
| affine transformation(仿射变换) | linear layer(线性层 / Dense层) | z=Wx+bz = Wx+bz=Wx+b,完全相同计算 |
5. 数据集 & 估计相关
| 统计学 | 深度学习工程 | 说明 |
|---|---|---|
| explanatory variable / predictor | feature / input | 输入特征 xxx |
| response variable / dependent variable | target / label | 要预测的标签 yyy |
| independent variable | feature | 自变量,也就是特征 |
| maximum likelihood estimation(MLE) | maximum likelihood training | 极大似然估计;DL分类训练本质就是MLE |
| empirical risk | training loss | 经验风险 = 在训练集上算的损失 |
6. 优化相关
| 统计学 | 深度学习工程 | 说明 |
|---|---|---|
| gradient descent(梯度下降) | gradient descent | 名字没变,但侧重点不同: 统计:用来求参数估计;DL:网络权重更新 |
| regularization(正则化) | weight decay(权重衰减) | L2正则,统计叫regularization,工程中L2常直接叫weight decay(注意二者不完全等价,Adam下有细微差别) |
二、看似等价,但不完全等同的术语
1. L2 Regularization(L2正则) vs Weight Decay(权重衰减)
粗略说法:二者经常被当成一回事
- L2正则:在损失函数上加项 λ2∥w∥2\frac{\lambda}{2}\|w\|^22λ∥w∥2
- Weight decay:参数更新时,直接对权重乘以 (1−λ)(1-\lambda)(1−λ)
核心差别(Adam 这类自适应优化器下明显)
- SGD:L2正则 ≈ weight decay,效果几乎一样,可以混用叫法。
- Adam / AdamW:
- 普通L2正则:把λw\lambda wλw加到梯度里,会被自适应学习率缩放,不是真正的权重衰减
- AdamW:直接在参数更新阶段做权重衰减,才是严格意义weight decay
✅总结:Adam下L2正则 ≠ weight decay,只有AdamW才实现真正weight decay。论文里提weight decay,默认优先指AdamW的实现。
2. Cross Entropy(交叉熵) vs Negative Log-Likelihood(NLL,负对数似然)
多分类场景,很多人直接划等号,但依赖网络输出层:
- 网络输出经过 Softmax:
CrossEntropyLoss= Softmax + NLL。- PyTorch
nn.CrossEntropyLoss:内部自带Softmax。输入是logits,不能提前softmax。
- PyTorch
- 网络输出已经是概率(已经Softmax):此时损失就是单纯 NLL。
- PyTorch
nn.NLLLoss:不带Softmax,要求输入log-prob(log(softmax))。
- PyTorch
坑点:
如果你把softmax后的概率喂给CrossEntropyLoss,模型训练直接出问题。
数学上:交叉熵损失 = 对logits做softmax之后的负对数似然,两者不是无条件等同。
3. Loss Function vs Cost Function
- Loss:单个样本的损失值
- Cost:整个训练集上loss的均值/总和
很多教材、博客随手混用。
坑:写公式时,有的作者cost定义为总和,有的是均值;调参时要看清楚公式定义,不然学习率需要对应缩放。
4. Basis function(基函数) vs Activation function(激活函数)
《Understanding Deep Learning》会把ReLU叫做basis function。
- 统计视角:ReLU构造一组基,把输入映射到新空间(basis function)
- DL工程视角:只是对线性输出做非线性变换(activation function)
⚠️不是所有激活函数都叫基函数。只有把隐层单元看作基的那套统计解释才这么称呼;sigmoid/tanh一般不会被叫做基函数。只是特定视角下的类比,不是通用等价定义。
5. Latent variable(隐变量) vs Embedding
- Latent variable:统计学概念,无法直接观测的变量;来源是概率模型(VAE、概率图模型)。
- Embedding:工程名词,低维稠密向量,可以是可学习参数,不一定有概率解释。
坑:所有embedding都可以叫latent variable吗?不。
普通推荐模型的user embedding,只是特征向量,不一定具备概率隐变量含义,只是大家习惯混用。
6. Affine transformation(仿射变换) vs Linear layer(Dense/全连接层)
仿射变换:Wx+bWx + bWx+b
- Linear变换严格定义:WxWxWx(无偏置,必须过原点)
- Affine = 线性变换 + 平移(+b)
坑:
深度学习里叫Linear层(Pytorch nn.Linear),它自带bias,本质是仿射变换。名字叫Linear,但数学上不是纯线性。
这是命名上最大陷阱之一!
数学:Linear ≠ Affine
工程:nn.Linear 是 Affine transformation。
更多推荐


所有评论(0)