📝 博客脉络方向

以下是一篇基于课堂实录整理而成的科普博客。我保留了老师在课堂上使用的全部生动案例与通俗比喻,并沿着“AI是什么→怎么实现→怎么自己学特征→怎么创造→集大成者大模型”的认知路径重新组织,希望能帮你把五个高频概念彻底理清楚。


一堂课厘清AI五大核心概念:从人工智能到大语言模型

课堂上,老师一上来就抛出了五个词:人工智能、机器学习、深度学习、生成式人工智能、大语言模型
“大家在广告里、饭桌上、课件里经常听到这些词,你们能分清楚谁是谁吗?是并列关系,还是父子关系?”
带着这个问题,我们从头开始梳理。


一、人工智能(AI):让机器像人一样思考、决策、行动

1.1 本质与定义

人工智能(Artificial Intelligence, AI)的本质是对人类智能的模拟。它不是单一的计算机学科,而是涉及统计学、脑神经科学、社会科学等多领域的交叉学科。简单来说,就是让机器变得“聪明”,能够完成原本只有人类才能做到的任务。

1.2 强人工智能 vs. 弱人工智能

老师把AI分成了两类:

  • 强人工智能:具备真正的心智和意识,能回答“我是谁”“我在哪”这种哲学问题。目前尚未实现。
  • 弱人工智能:在特定领域表现出智能行为,甚至在某些方面超越人类。我们现在生活中接触到的AI,全部属于弱人工智能。

为了说明弱AI如何“超越人类”(AI虽然是模拟人的,但是也可以有超越人类的地方),老师举了问界汽车的例子:

在晚上,人类的眼睛即使开灯,最远也只能看到50米左右;而问界装配的雷达感知距离能达到100-200米。更关键的是,在夜间遇到一些灰色物体,人眼可能根本看不清楚,但雷达经过计算分析后,能判定“前方是障碍物”,立即做出停车或变道决策。
这说明,AI的感知能力和计算力完全可以超越人类。

1.3 AI的运作闭环:感知 → 决策 → 执行

老师用问界汽车的自动驾驶完整拆解了AI工作的三个环节,这也是整堂课最核心的框架之一。

① 感知(Perception)
车辆通过摄像头和雷达,像人类的肉眼一样持续感知周边路况。它会发现:前方有一条斑马线,斑马线上有一位老奶奶。

② 决策(Decision)
这些感知数据被送入车内的“大脑”进行分析。系统形成认知:“前面有一位老奶奶正在过马路。”于是立刻制定策略:减速停车

③ 执行(Action)
决策转化为机械动作——踩刹车,稳稳停在斑马线前;等老奶奶过完马路,确认周边安全后,再踩油门启动离开。

整个过程没有人工干预,机器如同人一样完成了“思考、决策、行动”的闭环。原来需要人手握方向盘、脚踩刹车油门,现在机器自己就能完成。


二、典型应用:AI已经无处不在

理解了“感知-决策-执行”的框架后,老师又带我们看了一圈现实案例,证明AI已深度融入生活与各行各业。

2.1 具身智能:宇树机器狗爬楼梯

一只机器狗自动爬楼梯,看似三岁小孩都会,但对机器却极难。

  • 感知:头部摄像头扫描环境,识别楼梯结构、台阶高度及空隙。
  • 决策:软件系统分析出台阶高度(比如15公分),规划抬腿高度(比如16-17公分),并确定第一只脚、第二只脚、第三只脚、第四只脚的运动顺序。
  • 执行:精密控制机械部件,按规划路径完成攀爬。

老师特别强调:不要以为爬楼梯很简单,它同时涉及复杂的感知、算法决策与超强执行力。

2.2 军事应用:智能无人机

以现代战争(如俄乌冲突)为例,过去二战时期动辄几百辆坦克集群作战,现在无人机及蜂群战术正在取代旧模式。

工作流程同样是“感知-决策-执行”:

  1. 识别:在画面中发现敌方坦克。
  2. 瞄准与计算:精准计算投掷角度与力度。
  3. 打击:实施精确轰炸。

老师据此判断:未来的战争将高度依赖AI,呈现“AI战争”形态。

2.3 日常生活

  • 自动驾驶:感知前方黑车停下,或识别前方弯道,自动执行刹车或转向。
  • 生物识别与支付:手机指纹解锁、人脸识别解锁、支付宝刷脸支付,都基于AI视觉识别。
  • 推荐算法:你之所以在抖音上停留那么久,是因为背后有AI推荐算法——“你喜欢什么,我就给你推什么”。

三、机器学习(Machine Learning,简称:ML):实现AI最主要的方法

3.1 AI与ML的关系

如果说AI是终极目标(让机器具备类人智能),那么机器学习(Machine Learning, ML)就是实现这个目标最主要的方法

机器学习的核心价值在于:不再依赖人工手动编写规则,而是通过数据训练算法,让计算机从历史样本中自动总结规律,用于对新问题进行预测和决策。

3.2 核心概念拆解:出租车计费案例

为了让我们理解,老师举了一个极其生活化的例子:出租车打表

已知:

  • 跑1公里,费用12元
  • 跑2公里,费用14元
  • 跑3公里,费用16元

问:跑10公里要多少钱?

学过初中数学的人立刻能列出方程:y = ax + b,代入两组数据,求出 a = 2b = 10。因此当 x = 10 时,y = 30

但机器学习不是这样“人工一步步求解”的。 它的逻辑是:

  • 你只需把 x(公里数)和 y(费用)的对应关系丢给机器。
  • 机器自动化找到参数 ab
  • 这个过程叫做模型训练(Training / Learning)

由此引出一组关键概念:

概念解释出租车案例对应
特征(Feature)影响结果的关键输入信息行驶公里数 x
参数(Parameters)方程里的系数a = 2b = 10
模型(Model)“骨架”(方程形式)+ “参数”组成的完整计算单元y = 2x + 10
模型文件实际存储的就是这些参数值文件中存着 210

当模型确立后,你输入新的特征值(如 x = 10),模型算出 y = 30,这个过程叫做模型预测 / 推理(Prediction / Inference)

3.3 从简单到复杂:方言识别与函数拟合

老师接着抛出一个更复杂的问题:给你一段音频,判断这是四川话、河南话还是河北话。

  • 输入 x 是一段音频,输出 y 是方言类别。
  • 这个问题的参数规模可达近10万量级
  • 从小学到大学,你都没解过这么多参数的方程,但机器学习能够自动化地找到这海量参数的值

因此,机器学习的本质可以抽象为:

在给定 xy 的情况下,让机器自动找到对应的函数关系 y = f(x)
由于现实数据分布复杂,找到的函数往往无法精准穿过每一个点,所以更准确的描述是找到近似函数,即 f(x) ≈ y


四、深度学习(Deep Learning,简称:DL):让机器自动学习特征

4.1 层级关系再厘清

  • AI:最终目标
  • ML:实现AI最重要的方式
  • DL(Deep Learning):机器学习的一个分支,也是当前最热门的方法

4.2 与传统机器学习的本质区别

传统机器学习有一个让人头疼的环节——人工特征工程。老师举了两个画面:

  • 要识别一辆车,需要人工定义特征:“有4个轮子”“有后视镜”“能跑120公里”。
  • 要识别一个人,需要人工定义特征:“有一个头”“两个胳膊”“两条腿”……

这些特征需要领域专家一点点去找,非常繁琐。

深度学习的革命性在于:它直接取消了复杂的人工特征工程。 你只需提供原始数据(比如一张图片的像素),模型会自动从原始数据中逐层抽象出对应特征,并计算出映射函数 f,直接完成从 xy 的预测。

4.3 神经网络结构

典型的神经网络由三层构成:

  1. 输入层:接收原始数据 x(比如把图像转换成RGB数字矩阵)。
  2. 隐藏层:包含一系列参数(也叫权重/Weights),逐层抽象高级特征。
  3. 输出层:输出最终预测结果 y

4.4 案例:神经网络怎么区分“西红柿炒鸡蛋”与“青椒炒鸡蛋”?

老师用这道菜做例子,生动展示了神经网络“逐层学习”的过程:

  • 输入层:照片被拆成计算机能看懂的数字(像素/RGB值)。
  • 第二层(颜色特征):通过参数学习到“图片里有红色(西红柿)和黄色(鸡蛋)”。
  • 第三层(形状特征):进一步学习“西红柿是一块一块的,鸡蛋是絮状的”。
  • 第四层(空间特征):学习特征之间的空间关系——红色和黄色是混合在一起的,而不是左边全红、右边全黄。
  • 第五层(输出判定):综合以上特征,判定这是“西红柿炒鸡蛋”。如果检测到绿色,那大概率是“青椒炒鸡蛋”,直接排除。

老师特别强调:这些特征(颜色、形状、空间关系)不是人写进去的,而是模型根据任务需求自动学习得到的。 你只需给几千张“西红柿炒鸡蛋”的原始图片即可。

4.5 数学本质:函数的“套娃”

深度学习的数学本质非常形象——函数的嵌套(套娃结构)

  • 第一层隐藏层:h₁ = f₁(x)
  • 第二层隐藏层:h₂ = f₂(h₁)
  • ……
  • 最终输出:Y = f(...f(f(x))...)

每一层的输出作为下一层的输入,一层一层套起来。

4.6 为什么叫“深度”和“隐藏层”?

  • 隐藏层:除了输入层和输出层,中间层的特征对人眼不可见;当参数达到数十亿级别时,人类根本难以解释某一层的具体含义,所以叫“隐藏”。
  • 深度:指网络层数极多。GPT-3有96层,GPT-4达到了120层,包含百亿级参数。层数多、参数多,所以叫“深度”学习。

五、生成式AI(Generative AI,简称:GenAI):从“分析世界”到“创造世界”

5.1 概念与定位

**生成式人工智能(Generative AI, GenAI)**全称应为 Generative AI,是AI的一个分支。截至目前,所有的GenAI都基于深度学习完成。

它与传统AI的核心区别在于任务重心:

维度传统AI生成式AI
核心重心分析(Analyze)生成(Generate)
典型任务图像分类、用户画像、数据预测写作文、画画、生成视频
角色比喻分析者创作者、造物主

老师把这次转变称为质的跨越

过去我们拿数据做分析(NLP(Natural Language Processing,自然语言处理)、CV(Computer Vision,计算机视觉)本质上都是分析);现在你给AI一个目标,它直接给你创造出一个从未存在过的结果。

5.2 工作原理:成语接龙与概率采样

GenAI到底是怎么“创作”的?老师给出的核心机制非常通俗:它是一个基于概率列表的随机抽奖过程,就像成语接龙,逐字生成。

以句子**“今天天气真____”**为例:

  1. 模型内部计算出一个候选词概率列表:

    • “好” → 45%
    • “不” → 20%
    • “热” → 15%
    • “冷” → 10%
  2. 第一次采样:模型像“摇骰子”一样随机抽取。如果命中45%,就输出“好”,句子变成“今天天气真好”。

  3. 动态迭代:如果第一次抽中的是“不”,句子变成“今天天气真不”。此时上下文已改变,模型会重新计算所有候选词的概率分布(概率表已刷新),再进行下一次采样。

  4. 如此循环往复,一个字接一个字,最终连成完整文章。

老师总结:GenAI的工作过程就是一个连续的、基于上下文动态调整概率的“接龙”过程。它标志着AI从“分析世界”跨越到了“创造世界”。


六、大语言模型(Large Language Model,简称:LLM):生成式AI的集大成者

6.1 定义与“大”的三大含义

大语言模型(Large Language Model, LLM)是人工智能领域的核心突破。它是一种通过海量文本训练而成、拥有巨量参数、能够理解和生成人类语言的概率模型(即前面说的“接龙/掷骰子”机制)。

这里的“大”体现在三个维度:

① 数据大

  • GPT-3(2020年)原始数据达45TB,清洗后有效数据约570GB
  • DeepSeek V3使用了14.8万亿Token的数据量。

② 参数大

  • GPT-3参数量达到1750亿(175 Billion)
  • 截至2024年,部分模型参数量已达670亿甚至更高。

③ 算力大

  • GPT-4训练使用了2万多张高端显卡(如NVIDIA A100),单卡显存至少40GB
  • 训练电费就烧掉了数千万美金
  • 模型权重文件动辄几百GB,普通消费级显卡(6GB/8GB显存)根本无法加载。

6.2 能理解,更能精准生成

老师用大语言模型的“听话”能力,解释了什么叫“理解与生成”:

你让它写一篇关于“春天”的作文,它不会写成冬天;你让它写500字,它会生成500字左右;你让它写800字,它也能生成800字左右。它能精准响应主题与格式要求,而非输出固定长度的无关内容。

6.3 三大主流架构

目前大模型主要分为三类:

  1. Decoder-only(仅解码器):擅长内容生成。代表:GPT系列、DeepSeek系列。
  2. Encoder-only(仅编码器):擅长完形填空、情感分类等理解类任务。代表:BERT。
  3. Encoder-Decoder(编码器-解码器组合):常用于机器翻译等序列到序列任务。代表:T5。

老师提醒我们:BERT虽然也是大语言模型,但它严格来说更偏向“完形填空”式的理解,而非生成全新内容;不过在实际应用和面试中,把大语言模型归为生式AI或AI的分支都是被广泛接受的。


七、一张图理清五者关系

课程最后,老师带我们回顾了这五个词的完整层级:

  1. 人工智能(AI):终极目标——让机器具备人类智能。
  2. 机器学习(ML):实现AI最重要的方法——自动化寻找数据间 xy 的关系(出租车计费那个例子)。
  3. 深度学习(DL):机器学习最热门的分支——取消人工特征工程,直接拿原始数据训练(西红柿炒鸡蛋那个例子)。
  4. 生成式AI(GenAI):基于深度学习构建——从分析转向创造,按用户要求生成全新内容(写作文、画图、生成视频)。
  5. 大语言模型(LLM):生成式AI的核心载体——数据大、参数大、算力大,真正理解并生成人类语言。

结语

如果你依然觉得这些概念很抽象,老师给了一句最通俗的总结:

人工智能的本质,始终是让机器像人一样进行思考、决策和行动。
如果你还不理解,就想象一下问界汽车过斑马线的那个例子——它用雷达和摄像头“看”到老人,用大脑“决定”停车,用刹车和油门“执行”动作。
而现在,从最底层的感知,到生成一篇800字的春天作文,AI已经走完了从“感知世界”到“创造世界”的完整跃迁。

更多推荐