AI大模型与数学第41课:级数基础、收敛判定
一、课程前言(通俗导入)
前面我们学了:导数看瞬间变化、积分看无限累积、微分方程看系统演化、向量场看变化趋势。
今天我们学级数,它是微积分、傅里叶变换、大模型数值计算的终极底层基石。
学习级数,其实核心逻辑只有一句话:
级数就是:把一个复杂的数、复杂的函数,拆成「无限多个简单小块相加」。
AI大模型为什么需要它?
因为电脑、AI、芯片只能做加减乘除,无法直接计算复杂函数、无限小数、连续变换。
所有高端AI运算,本质都是:用无数个简单项相加,无限逼近真实结果,而判定能不能逼近、会不会算崩,靠的就是级数收敛判定。
这节课我生活化举例,落地大模型真实作用。
二、基础概念:数列 vs 级数(彻底分清)
- 数列(只看“单独每一项”)
一串按顺序排列的数字,就叫数列:
1,\ \frac12,\ \frac14,\ \frac18,\ \frac{1}{16}\dots
特点:只罗列数字,不做相加。
- 级数(核心:无限累加)
把数列里无穷多所有项全部加起来,就是级数:
S=1+\frac12+\frac14+\frac18+\frac{1}{16}+\dots
- 核心通俗理解
- 数列 = 排队的一个个小块
- 级数 = 把所有小块全部堆在一起求和
有限项相加,结果一定是固定数字,没有任何争议;
无限项相加,会出现两种神奇情况:
- 加无数次,总和越来越靠近一个固定数 → 收敛(稳定、可用)
- 加无数次,总和越来越大、飞到无穷大 → 发散(爆炸、不可用)
这是整节课、也是AI计算最关心的核心:收敛与发散。
三、级数收敛、发散通俗定义
- 收敛级数
无限个小数不断相加,越往后加,增量越小,最后总和无限贴近一个固定常数。
✅生活例子:走路悖论
你距离终点1米:
第一步走 \displaystyle \frac12 米
第二步走 \displaystyle \frac14 米
第三步走 \displaystyle \frac18 米
无限走下去:
\frac12+\frac14+\frac18+\dots=1
走无限步,最终刚好收敛等于1米,不会超、不爆炸、稳定。
- 发散级数
无限个数相加,越加越大,没有上限,最终趋向无穷大。
✅通俗例子:
1+1+1+1+\dots
无限个1相加,总和直接飞到无穷大,彻底爆炸,无法使用。
- 一句话总结本质
- 收敛:无限相加 → 结果有限、稳定、可控(AI可以计算、可以逼近)
- 发散:无限相加 → 结果无穷、失控、爆炸(AI计算直接失效、梯度爆炸)
四、最核心两类基础级数(AI必用)
第一类:等比级数(大模型近似计算核心)
形式:
\sum_{n=0}^{\infty} q^n = 1+q+q2+q3+\dots
收敛判定超级简单(记住即可)
1.<1$ → 收敛,总和公式:\displaystyle S=\frac{1}{1-q}
2. |q|\ge1 → 发散
举例实操
例1:\displaystyle q=\frac12
1+\frac12+\frac14+\dots=\frac{1}{1-\frac12}=2
无限相加,稳定收敛到2。
例2:\displaystyle q=2
1+2+4+8+\dots
越加越大,发散爆炸。
AI核心逻辑:所有权重衰减、迭代逼近、截断计算,全部依赖「公比小于1的收敛等比级数」。
第二类:调和级数(经典发散反例)
形式:
\sum_{n=1}^{\infty}\frac1n=1+\frac12+\frac13+\frac14+\dots
小白直观错觉:每一项越来越小,应该收敛?
❌ 结论:依然发散,只是爆炸速度非常慢。
启示:
不是“项变小就一定收敛”,必须严格判定,凭直觉会导致模型计算出错、精度异常。
五、通用收敛判定方法
不用记复杂推导,只记AI实用判定规则,够用、精准、适配模型场景。
判定1:必要条件(一眼筛除发散级数)
若级数 \sum a_n 收敛,一定满足:
\lim_{n\to\infty} a_n=0
逆否超级重要:
如果最后一项不趋近0,直接判定发散。
举例:1+1.1+1.2+\dots
项越来越大,不趋近0 → 直接发散。
⚠️ 关键提醒:
项趋近0 不一定收敛(比如调和级数),只是“收敛的入场券”。
判定2:比值判别法(AI工程最常用)
针对带乘方、阶乘的级数,最适合计算机批量判定:
设极限 \displaystyle L=\lim_{n\to\infty}\left|\frac{a_{n+1}}{a_n}\right|
1.<1$ → 绝对收敛(模型可用,稳定)
2. L>1 → 发散(模型禁用,会爆炸)
3. L=1 → 无法判定,需其他方法
六、级数为什么是AI大模型的底层命脉?(核心落地意义)
- AI所有复杂函数,都是「级数拼接出来的」
电脑无法直接计算:e^x、\sin x、\ln x 等复杂函数。
计算机、AI底层逻辑:
把复杂函数 = 拆成无数个简单幂级数相加
比如自然指数级数(大模型激活函数核心):
ex=1+x+\frac{x2}{2!}+\frac{x^3}{3!}+\dots
AI训练时,只会取前有限项相加:
- 级数收敛 → 取前几项就能无限逼近真实值,计算精准
- 级数发散 → 越算越偏,梯度直接爆炸
- 模型梯度下降、迭代更新,本质是级数求和
大模型每次迭代更新一点点权重:
w_{新}=w_{旧}-\eta\cdot \text{梯度}
一次次微小更新,无限次迭代就是一个无穷级数。
- 级数收敛 → 权重慢慢稳定、损失收敛、模型训练成功
- 级数发散 → 权重越更越乱、损失飞涨、梯度爆炸/消失
- 傅里叶变换、信号嵌入、语义编码全靠级数
后续我们学的傅里叶级数,本质是:
把任何复杂语义信号、图像信号,拆成无数简单正弦波级数相加
没有级数收敛判定:
- 无法做信号分解
- 无法做词向量嵌入
- 无法做图像AI降噪、特征提取
- 大模型“截断计算”的数学依据
AI永远不会算无穷级数,只会截断前N项:
之所以可以截断,唯一原因:级数收敛,后面的项无限趋近0,对结果影响可以忽略。
这是所有AI高效计算、算力节省的底层数学原理。
七、本节课核心总结
- 数列是有限/无限数字排队,级数是无限数字累加;
- 级数只有两种命运:收敛(稳定可用)、发散(爆炸失效);
- 等比级数是AI最常用基础级数,公比小于1必然收敛;
- 收敛不是“项变小就行”,必须依靠严格数学判定;
- AI大模型的函数计算、梯度迭代、信号分解、算力截断,全部建立在收敛级数的数学基础之上;
- 级数,是微积分通往AI工程落地的最后一层基础桥梁。
八、下节课预告
下一节课:幂级数展开、泰勒级数
解锁AI终极能力:任何复杂函数,全部拆成多项式,让电脑精准计算,彻底打通大模型数值计算的核心秘密。
课后思考题(极简巩固)
- q=0.8 的等比级数是收敛还是发散?
- AI梯度爆炸,对应级数的哪种状态?
这节课我们重点讲了:级数不是简单的无限相加,而是AI大模型做函数逼近、数值计算、梯度下降截断的数学基础。
核心记住三句话:
- 级数 = 无限多项相加
- 收敛 = 结果稳定,AI可以放心计算
- 发散 = 结果爆炸,模型容易出现梯度异常或计算失控
下一课我们讲:幂级数展开与泰勒级数。
这部分非常关键,因为它能解释:为什么电脑明明只会做加减乘除,却能计算复杂函数。
如果你想系统从微积分、线性代数、概率统计一路看懂AI大模型,欢迎关注我,后面会持续更新更完整的数学体系课。
更多推荐


所有评论(0)