一、课程前言(通俗导入)

前面我们学了:导数看瞬间变化、积分看无限累积、微分方程看系统演化、向量场看变化趋势。

今天我们学级数,它是微积分、傅里叶变换、大模型数值计算的终极底层基石。

学习级数,其实核心逻辑只有一句话:
级数就是:把一个复杂的数、复杂的函数,拆成「无限多个简单小块相加」。

AI大模型为什么需要它?
因为电脑、AI、芯片只能做加减乘除,无法直接计算复杂函数、无限小数、连续变换。
所有高端AI运算,本质都是:用无数个简单项相加,无限逼近真实结果,而判定能不能逼近、会不会算崩,靠的就是级数收敛判定。

这节课我生活化举例,落地大模型真实作用。

二、基础概念:数列 vs 级数(彻底分清)

  1. 数列(只看“单独每一项”)

一串按顺序排列的数字,就叫数列:
1,\ \frac12,\ \frac14,\ \frac18,\ \frac{1}{16}\dots
特点:只罗列数字,不做相加。

  1. 级数(核心:无限累加)

把数列里无穷多所有项全部加起来,就是级数:
S=1+\frac12+\frac14+\frac18+\frac{1}{16}+\dots

  1. 核心通俗理解
  • 数列 = 排队的一个个小块
  • 级数 = 把所有小块全部堆在一起求和

有限项相加,结果一定是固定数字,没有任何争议;
无限项相加,会出现两种神奇情况:

  1. 加无数次,总和越来越靠近一个固定数 → 收敛(稳定、可用)
  2. 加无数次,总和越来越大、飞到无穷大 → 发散(爆炸、不可用)

这是整节课、也是AI计算最关心的核心:收敛与发散。

三、级数收敛、发散通俗定义

  1. 收敛级数

无限个小数不断相加,越往后加,增量越小,最后总和无限贴近一个固定常数。

✅生活例子:走路悖论
你距离终点1米:
第一步走 \displaystyle \frac12 米
第二步走 \displaystyle \frac14 米
第三步走 \displaystyle \frac18 米
无限走下去:
\frac12+\frac14+\frac18+\dots=1
走无限步,最终刚好收敛等于1米,不会超、不爆炸、稳定。

  1. 发散级数

无限个数相加,越加越大,没有上限,最终趋向无穷大。

✅通俗例子:
1+1+1+1+\dots
无限个1相加,总和直接飞到无穷大,彻底爆炸,无法使用。

  1. 一句话总结本质
  • 收敛:无限相加 → 结果有限、稳定、可控(AI可以计算、可以逼近)
  • 发散:无限相加 → 结果无穷、失控、爆炸(AI计算直接失效、梯度爆炸)

四、最核心两类基础级数(AI必用)

第一类:等比级数(大模型近似计算核心)

形式:
\sum_{n=0}^{\infty} q^n = 1+q+q2+q3+\dots

收敛判定超级简单(记住即可)

1.<1$ → 收敛,总和公式:\displaystyle S=\frac{1}{1-q}
2. |q|\ge1 → 发散

举例实操

例1:\displaystyle q=\frac12
1+\frac12+\frac14+\dots=\frac{1}{1-\frac12}=2
无限相加,稳定收敛到2。

例2:\displaystyle q=2
1+2+4+8+\dots
越加越大,发散爆炸。

AI核心逻辑:所有权重衰减、迭代逼近、截断计算,全部依赖「公比小于1的收敛等比级数」。

第二类:调和级数(经典发散反例)

形式:
\sum_{n=1}^{\infty}\frac1n=1+\frac12+\frac13+\frac14+\dots

小白直观错觉:每一项越来越小,应该收敛?
❌ 结论:依然发散,只是爆炸速度非常慢。

启示:
不是“项变小就一定收敛”,必须严格判定,凭直觉会导致模型计算出错、精度异常。

五、通用收敛判定方法

不用记复杂推导,只记AI实用判定规则,够用、精准、适配模型场景。

判定1:必要条件(一眼筛除发散级数)

若级数 \sum a_n 收敛,一定满足:
\lim_{n\to\infty} a_n=0

逆否超级重要:
如果最后一项不趋近0,直接判定发散。

举例:1+1.1+1.2+\dots
项越来越大,不趋近0 → 直接发散。

⚠️ 关键提醒:
项趋近0 不一定收敛(比如调和级数),只是“收敛的入场券”。

判定2:比值判别法(AI工程最常用)

针对带乘方、阶乘的级数,最适合计算机批量判定:
设极限 \displaystyle L=\lim_{n\to\infty}\left|\frac{a_{n+1}}{a_n}\right|
1.<1$ → 绝对收敛(模型可用,稳定)
2. L>1 → 发散(模型禁用,会爆炸)
3. L=1 → 无法判定,需其他方法

六、级数为什么是AI大模型的底层命脉?(核心落地意义)

  1. AI所有复杂函数,都是「级数拼接出来的」

电脑无法直接计算:e^x、\sin x、\ln x 等复杂函数。
计算机、AI底层逻辑:
把复杂函数 = 拆成无数个简单幂级数相加

比如自然指数级数(大模型激活函数核心):
ex=1+x+\frac{x2}{2!}+\frac{x^3}{3!}+\dots

AI训练时,只会取前有限项相加:

  • 级数收敛 → 取前几项就能无限逼近真实值,计算精准
  • 级数发散 → 越算越偏,梯度直接爆炸
  1. 模型梯度下降、迭代更新,本质是级数求和

大模型每次迭代更新一点点权重:
w_{新}=w_{旧}-\eta\cdot \text{梯度}
一次次微小更新,无限次迭代就是一个无穷级数。

  • 级数收敛 → 权重慢慢稳定、损失收敛、模型训练成功
  • 级数发散 → 权重越更越乱、损失飞涨、梯度爆炸/消失
  1. 傅里叶变换、信号嵌入、语义编码全靠级数

后续我们学的傅里叶级数,本质是:
把任何复杂语义信号、图像信号,拆成无数简单正弦波级数相加

没有级数收敛判定:

  • 无法做信号分解
  • 无法做词向量嵌入
  • 无法做图像AI降噪、特征提取
  1. 大模型“截断计算”的数学依据

AI永远不会算无穷级数,只会截断前N项:
之所以可以截断,唯一原因:级数收敛,后面的项无限趋近0,对结果影响可以忽略。

这是所有AI高效计算、算力节省的底层数学原理。

七、本节课核心总结

  1. 数列是有限/无限数字排队,级数是无限数字累加;
  2. 级数只有两种命运:收敛(稳定可用)、发散(爆炸失效);
  3. 等比级数是AI最常用基础级数,公比小于1必然收敛;
  4. 收敛不是“项变小就行”,必须依靠严格数学判定;
  5. AI大模型的函数计算、梯度迭代、信号分解、算力截断,全部建立在收敛级数的数学基础之上;
  6. 级数,是微积分通往AI工程落地的最后一层基础桥梁。

八、下节课预告

下一节课:幂级数展开、泰勒级数
解锁AI终极能力:任何复杂函数,全部拆成多项式,让电脑精准计算,彻底打通大模型数值计算的核心秘密。

课后思考题(极简巩固)

  1. q=0.8 的等比级数是收敛还是发散?
  2. AI梯度爆炸,对应级数的哪种状态?

这节课我们重点讲了:级数不是简单的无限相加,而是AI大模型做函数逼近、数值计算、梯度下降截断的数学基础。

核心记住三句话:

  1. 级数 = 无限多项相加
  2. 收敛 = 结果稳定,AI可以放心计算
  3. 发散 = 结果爆炸,模型容易出现梯度异常或计算失控

下一课我们讲:幂级数展开与泰勒级数。
这部分非常关键,因为它能解释:为什么电脑明明只会做加减乘除,却能计算复杂函数。
如果你想系统从微积分、线性代数、概率统计一路看懂AI大模型,欢迎关注我,后面会持续更新更完整的数学体系课。

更多推荐