概率论、信息论与深度学习基础

5.1 前言

深度学习与大模型本质上是一套概率建模系统。大语言模型输出文本不是确定性计算,而是从概率分布中采样得到结果。Transformer、损失函数、熵、KL 散度、最大似然估计,所有现代大模型核心组件,底层全部建立在概率论与信息论之上。很多零基础学习者直接上手代码,却看不懂损失函数、困惑模型为什么会 “随机生成文字”,根源就是缺少本章知识储备。

传统软件工程追求确定输出:相同输入得到相同输出。但人工智能任务天然存在不确定性:同一句话可以有多种合理回答、一张图片存在多种标签可能性。概率论提供描述不确定性的数学语言,信息论量化信息、冗余、误差,二者结合构成训练大模型的理论基石。本章避开纯数学系晦涩证明,聚焦所有知识点在大模型中的实际用途,所有概念附带深度学习实例。

5.2 概率基础定义

5.2.1 随机变量

随机变量是从随机事件映射到数值的函数,分为两类:

  1. 离散随机变量:取值有限 / 可数集合。例如 LLM 词汇表 token 编号,取值 0~32000(常见 Llama 词表规模);抛硬币结果。离散变量对应概率质量函数 PMF

\(P(X=x)\) 满足约束:\(\sum_{x}P(X=x)=1\)

  1. 连续随机变量:取值连续区间,例如神经网络神经元输出的激活值。使用概率密度函数 PDF \(p(x)\)。积分约束:

\(\int_{-\infty}^{+\infty} p(x)dx=1\)

⚠️关键区分:离散用P大写,连续用p小写,工业论文通用规范。

案例:GPT 系列模型中,每一步预测下一个 token,词汇表 32768 个候选 token,属于离散随机变量;模型输出 logits 经过 softmax 转换,得到每个 token 对应的概率质量分布。

5.2.2 联合概率、条件概率、链式法则

联合概率:\(P(X=x,Y=y)\),事件 X、Y 同时发生概率。 条件概率定义式:

\(P(Y|X)=\frac{P(X,Y)}{P(X)}\) 变形得到概率链式法则:

\(P(X_1,X_2,...,X_n)=P(X_1)P(X_2|X_1)P(X_3|X_1,X_2)...P(X_n|X_1,...,X_{n-1})\)

大模型最重要应用场景:自回归生成! 大语言模型生成文本,就是利用链式法则。一段文本序列 \(w_1,w_2,w_3...w_T\)

\(P(w_1,w_2...w_T)=\prod_{t=1}^T P(w_t|w_1,w_2,...,w_{t-1})\) 这就是自回归语言建模(Autoregressive LM)核心公式。GPT、Llama、Qwen 全部基于该公式训练。训练目标就是拟合这个条件概率分布。很多教程直接抛出自回归概念,却不会追溯到概率链式法则,这是初学者最大知识断层。

5.2.3 独立与条件独立

若 \(P(X,Y)=P(X)P(Y)\),X 与 Y 相互独立。 条件独立:\(P(X,Y|Z)=P(X|Z)P(Y|Z)\),记作 \(X\perp\!\!\!\perp Y \mid Z\)。 Transformer 架构中,掩码注意力机制本质就是引入条件独立假设;在序列建模中,屏蔽未来 token,保证预测\(w_t\)不能看到后续文字,满足因果约束。

5.3 期望、方差、协方差

5.3.1 数学期望

离散:\(\mathbb{E}[X]=\sum_x xP(x)\) 连续:\(\mathbb{E}[X]=\int_x x p(x)dx\) 期望线性性质(极其重要,不受变量独立约束):

\(\mathbb{E}[aX+bY]=a\mathbb{E}[X]+b\mathbb{E}[Y]\) 神经网络梯度计算、损失均值计算全程依赖该性质。训练时我们不会只用单样本损失,而是计算一个 batch 内损失的均值,本质就是求经验期望。

5.3.2 方差与标准差

方差:衡量随机变量波动范围

\(Var(X)=\mathbb{E}[(X-\mathbb{E}[X])^2]\) 标准差 \(\sigma=\sqrt{Var(X)}\) 神经网络中层归一化 (LayerNorm)、批量归一化 (BatchNorm),核心操作就是利用期望和方差将输入数据缩放至标准分布,解决深度模型梯度消失、内部协变量偏移问题。

5.3.3 协方差、相关系数

协方差:

\(Cov(X,Y)=\mathbb{E}\big[(X-\mathbb{E}[X])(Y-\mathbb{E}[Y])\big]\) 协方差正数:变量同向变化;负数反向;0 代表无线性相关。 协方差矩阵:深度学习多维特征标配。一批数据特征向量构成矩阵,协方差矩阵刻画特征之间线性关联,主成分分析 PCA 依托协方差矩阵实现。

5.4 常用概率分布及其在 AI 大模型中的应用

5.4.1 伯努利分布

单次二分类事件,\(X\in\{0,1\}\)

\(P(X=1)=p,\quad P(X=0)=1-p\) 应用:二分类任务、图像分类正负样本判别、激活函数理论分析。

5.4.2 分类分布(Categorical Distribution)

伯努利分布推广到多类别,大模型最核心分布。 拥有 k 个类别,概率 \(p_1,p_2,...,p_k,\sum p_i=1\)。 模型输出 softmax 向量就是分类分布参数。LLM 下一个 token 采样,就是从分类分布抽样。 采样策略:贪心采样(取最大概率 token)、Top-k、Top-p(核采样)全部建立在分类分布之上。

5.4.3 正态分布(高斯分布)

一维正态分布:

\(\mathcal{N}(x;\mu,\sigma^2)=\frac{1}{\sqrt{2\pi\sigma^2}}\exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)\) 深度学习无处不在:

  1. 神经网络权重初始化默认使用高斯分布;
  2. 扩散模型(文生图、Sora 视频模型)核心数学基础;
  3. 残差网络、归一化模块假设输入逼近正态分布;
  4. 连续型强化学习智能体策略输出。

多维高斯分布被广泛用于多模态大模型表征建模。

5.5 最大似然估计 MLE

5.5.1 定义

给定数据集,寻找模型参数\(\theta\),使得观测数据出现概率最大。 数据集 \(D=\{x_1,x_2,...,x_N\}\),样本独立同分布:

\(\theta_{MLE}=\mathop{\arg\max}_{\theta}\prod_{i=1}^N p(x_i;\theta)\) 连乘极易数值下溢,取对数转化求和(对数似然):

\(\theta_{MLE}=\mathop{\arg\max}_{\theta}\sum_{i=1}^N \log p(x_i;\theta)\) 最大化对数似然 = 最小化负对数似然 (NLL)

重点实战关联:大语言模型训练损失函数,就是负对数似然! 训练 GPT 时,输入文本序列,不断最小化所有 token 的负对数似然,等价于最大化真实文本出现概率。这是整个预训练阶段的目标函数。很多学习者训练模型只会调用CrossEntropyLoss,不知道交叉熵损失本质就是离散分布下的负对数似然。

5.5.2 最大后验估计 MAP(拓展)

MLE 只利用数据,MAP 引入参数先验分布,等价于带正则项的 MLE。

\(\theta_{MAP}=\mathop{\arg\max}_{\theta} \log p(D|\theta)+\log p(\theta)\) L2 正则、权重衰减(Weight Decay)可以从 MAP 角度解释,帮助抑制模型过拟合,大模型微调阶段高频使用。

5.6 信息论核心概念(大模型必备)

5.6.1 自信息

\(I(x)=-\log P(x)\) 概率越低的事件,携带信息量越大。例如一句罕见专业术语,信息量远高于 “你好,谢谢”。对数底数常用 2,单位比特 bit。

5.6.2 香农熵(信息熵)

离散分布熵:

\(H(P)=-\sum_x P(x)\log P(x)\) 熵衡量随机变量不确定性。

  • 熵越大:分布越均匀,不确定性越高;
  • 熵等于 0:确定事件,无不确定性。

实例:LLM 输出分布,如果所有 token 概率接近,熵很高,模型输出发散、随机性强;如果单个 token 概率接近 1,熵很低,输出非常确定。工程上可以监控生成文本熵,动态调节采样温度。

5.6.3 交叉熵

\(H(P,Q)=-\sum_x P(x)\log Q(x)\) P 代表真实数据分布,Q 代表模型预测分布。 交叉熵就是分类任务标准损失函数。为什么不用均方误差训练分类网络?理论层面:均方误差搭配 sigmoid 容易梯度消失,交叉熵梯度形式简洁,训练稳定性更强。

5.6.4 KL 散度(相对熵)

\(D_{KL}(P||Q)=\sum_x P(x)\log\frac{P(x)}{Q(x)}\) 衡量两个概率分布之间距离,性质:\(D_{KL}\ge0\),非对称。 关系公式:\(H(P,Q)=H(P)+D_{KL}(P||Q)\) 应用场景:

  1. 知识蒸馏:让学生模型分布逼近教师大模型分布,最小化 KL 散度;
  2. RLHF 人类反馈强化学习,约束模型输出分布,防止偏离预训练分布;
  3. 扩散模型、变分自编码器 VAE 核心损失。

5.6.5 互信息

\(I(X;Y)=D_{KL}(P(X,Y)||P(X)P(Y))\) 衡量两个变量共享信息,多模态大模型(图文模型)对齐图文表征,大量使用互信息最大化目标。

5.7 概率视角理解模型泛化与不确定性

深度学习模型存在两类不确定性:

  1. 认知不确定性:模型参数不确定,数据不足导致;
  2. 偶然不确定性:任务本身固有随机(同一提问存在多种正确答案)。

大模型幻觉问题可以从概率角度解释:模型学习得到的分布与真实世界分布存在偏差,高概率生成不符合事实的文本。 温度参数(Temperature)本质:缩放 logits,调整输出分布平滑程度。

\(p_i=\frac{\exp(z_i/T)}{\sum\exp(z_j/T)}\) T>1,分布变平滑,熵上升,生成更多样;T<1,分布尖锐,输出更保守。这一参数的底层原理完全依托本章分布与熵理论。

5.8 本章小结与学习实践任务

本章搭建所有生成式 AI 的概率理论底座。没有本章基础,后续无法理解损失函数、采样策略、RLHF、知识蒸馏。 实践任务:

  1. 使用 Python 实现 softmax,手动计算分类分布熵;
  2. 编写代码观察温度参数如何改变概率分布;
  3. 推导:交叉熵损失等价于负对数似然。

更多推荐