【认识大模型】【一堂课厘清AI五大核心概念:从人工智能到大语言模型】流食般投喂
📝 博客脉络方向
以下是一篇基于课堂实录整理而成的科普博客。我保留了老师在课堂上使用的全部生动案例与通俗比喻,并沿着“AI是什么→怎么实现→怎么自己学特征→怎么创造→集大成者大模型”的认知路径重新组织,希望能帮你把五个高频概念彻底理清楚。
一堂课厘清AI五大核心概念:从人工智能到大语言模型
课堂上,老师一上来就抛出了五个词:人工智能、机器学习、深度学习、生成式人工智能、大语言模型。
“大家在广告里、饭桌上、课件里经常听到这些词,你们能分清楚谁是谁吗?是并列关系,还是父子关系?”
带着这个问题,我们从头开始梳理。
一、人工智能(AI):让机器像人一样思考、决策、行动
1.1 本质与定义
人工智能(Artificial Intelligence, AI)的本质是对人类智能的模拟。它不是单一的计算机学科,而是涉及统计学、脑神经科学、社会科学等多领域的交叉学科。简单来说,就是让机器变得“聪明”,能够完成原本只有人类才能做到的任务。
1.2 强人工智能 vs. 弱人工智能
老师把AI分成了两类:
- 强人工智能:具备真正的心智和意识,能回答“我是谁”“我在哪”这种哲学问题。目前尚未实现。
- 弱人工智能:在特定领域表现出智能行为,甚至在某些方面超越人类。我们现在生活中接触到的AI,全部属于弱人工智能。
为了说明弱AI如何“超越人类”(AI虽然是模拟人的,但是也可以有超越人类的地方),老师举了问界汽车的例子:
在晚上,人类的眼睛即使开灯,最远也只能看到50米左右;而问界装配的雷达感知距离能达到100-200米。更关键的是,在夜间遇到一些灰色物体,人眼可能根本看不清楚,但雷达经过计算分析后,能判定“前方是障碍物”,立即做出停车或变道决策。
这说明,AI的感知能力和计算力完全可以超越人类。
1.3 AI的运作闭环:感知 → 决策 → 执行
老师用问界汽车的自动驾驶完整拆解了AI工作的三个环节,这也是整堂课最核心的框架之一。
① 感知(Perception)
车辆通过摄像头和雷达,像人类的肉眼一样持续感知周边路况。它会发现:前方有一条斑马线,斑马线上有一位老奶奶。
② 决策(Decision)
这些感知数据被送入车内的“大脑”进行分析。系统形成认知:“前面有一位老奶奶正在过马路。”于是立刻制定策略:减速停车。
③ 执行(Action)
决策转化为机械动作——踩刹车,稳稳停在斑马线前;等老奶奶过完马路,确认周边安全后,再踩油门启动离开。
整个过程没有人工干预,机器如同人一样完成了“思考、决策、行动”的闭环。原来需要人手握方向盘、脚踩刹车油门,现在机器自己就能完成。
二、典型应用:AI已经无处不在
理解了“感知-决策-执行”的框架后,老师又带我们看了一圈现实案例,证明AI已深度融入生活与各行各业。
2.1 具身智能:宇树机器狗爬楼梯
一只机器狗自动爬楼梯,看似三岁小孩都会,但对机器却极难。
- 感知:头部摄像头扫描环境,识别楼梯结构、台阶高度及空隙。
- 决策:软件系统分析出台阶高度(比如15公分),规划抬腿高度(比如16-17公分),并确定第一只脚、第二只脚、第三只脚、第四只脚的运动顺序。
- 执行:精密控制机械部件,按规划路径完成攀爬。
老师特别强调:不要以为爬楼梯很简单,它同时涉及复杂的感知、算法决策与超强执行力。
2.2 军事应用:智能无人机
以现代战争(如俄乌冲突)为例,过去二战时期动辄几百辆坦克集群作战,现在无人机及蜂群战术正在取代旧模式。
工作流程同样是“感知-决策-执行”:
- 识别:在画面中发现敌方坦克。
- 瞄准与计算:精准计算投掷角度与力度。
- 打击:实施精确轰炸。
老师据此判断:未来的战争将高度依赖AI,呈现“AI战争”形态。
2.3 日常生活
- 自动驾驶:感知前方黑车停下,或识别前方弯道,自动执行刹车或转向。
- 生物识别与支付:手机指纹解锁、人脸识别解锁、支付宝刷脸支付,都基于AI视觉识别。
- 推荐算法:你之所以在抖音上停留那么久,是因为背后有AI推荐算法——“你喜欢什么,我就给你推什么”。
三、机器学习(Machine Learning,简称:ML):实现AI最主要的方法
3.1 AI与ML的关系
如果说AI是终极目标(让机器具备类人智能),那么机器学习(Machine Learning, ML)就是实现这个目标最主要的方法。
机器学习的核心价值在于:不再依赖人工手动编写规则,而是通过数据训练算法,让计算机从历史样本中自动总结规律,用于对新问题进行预测和决策。
3.2 核心概念拆解:出租车计费案例
为了让我们理解,老师举了一个极其生活化的例子:出租车打表。
已知:
- 跑1公里,费用12元
- 跑2公里,费用14元
- 跑3公里,费用16元
问:跑10公里要多少钱?
学过初中数学的人立刻能列出方程:y = ax + b,代入两组数据,求出 a = 2,b = 10。因此当 x = 10 时,y = 30。
但机器学习不是这样“人工一步步求解”的。 它的逻辑是:
- 你只需把
x(公里数)和y(费用)的对应关系丢给机器。 - 机器自动化找到参数
a和b。 - 这个过程叫做模型训练(Training / Learning)。
由此引出一组关键概念:
| 概念 | 解释 | 出租车案例对应 |
|---|---|---|
| 特征(Feature) | 影响结果的关键输入信息 | 行驶公里数 x |
| 参数(Parameters) | 方程里的系数 | a = 2,b = 10 |
| 模型(Model) | “骨架”(方程形式)+ “参数”组成的完整计算单元 | y = 2x + 10 |
| 模型文件 | 实际存储的就是这些参数值 | 文件中存着 2 和 10 |
当模型确立后,你输入新的特征值(如 x = 10),模型算出 y = 30,这个过程叫做模型预测 / 推理(Prediction / Inference)。
3.3 从简单到复杂:方言识别与函数拟合
老师接着抛出一个更复杂的问题:给你一段音频,判断这是四川话、河南话还是河北话。
- 输入
x是一段音频,输出y是方言类别。 - 这个问题的参数规模可达近10万量级。
- 从小学到大学,你都没解过这么多参数的方程,但机器学习能够自动化地找到这海量参数的值。
因此,机器学习的本质可以抽象为:
在给定
x和y的情况下,让机器自动找到对应的函数关系y = f(x)。
由于现实数据分布复杂,找到的函数往往无法精准穿过每一个点,所以更准确的描述是找到近似函数,即f(x) ≈ y。
四、深度学习(Deep Learning,简称:DL):让机器自动学习特征
4.1 层级关系再厘清
- AI:最终目标
- ML:实现AI最重要的方式
- DL(Deep Learning):机器学习的一个分支,也是当前最热门的方法
4.2 与传统机器学习的本质区别
传统机器学习有一个让人头疼的环节——人工特征工程。老师举了两个画面:
- 要识别一辆车,需要人工定义特征:“有4个轮子”“有后视镜”“能跑120公里”。
- 要识别一个人,需要人工定义特征:“有一个头”“两个胳膊”“两条腿”……
这些特征需要领域专家一点点去找,非常繁琐。
深度学习的革命性在于:它直接取消了复杂的人工特征工程。 你只需提供原始数据(比如一张图片的像素),模型会自动从原始数据中逐层抽象出对应特征,并计算出映射函数 f,直接完成从 x 到 y 的预测。
4.3 神经网络结构
典型的神经网络由三层构成:
- 输入层:接收原始数据
x(比如把图像转换成RGB数字矩阵)。 - 隐藏层:包含一系列参数(也叫权重/Weights),逐层抽象高级特征。
- 输出层:输出最终预测结果
y。
4.4 案例:神经网络怎么区分“西红柿炒鸡蛋”与“青椒炒鸡蛋”?
老师用这道菜做例子,生动展示了神经网络“逐层学习”的过程:
- 输入层:照片被拆成计算机能看懂的数字(像素/RGB值)。
- 第二层(颜色特征):通过参数学习到“图片里有红色(西红柿)和黄色(鸡蛋)”。
- 第三层(形状特征):进一步学习“西红柿是一块一块的,鸡蛋是絮状的”。
- 第四层(空间特征):学习特征之间的空间关系——红色和黄色是混合在一起的,而不是左边全红、右边全黄。
- 第五层(输出判定):综合以上特征,判定这是“西红柿炒鸡蛋”。如果检测到绿色,那大概率是“青椒炒鸡蛋”,直接排除。
老师特别强调:这些特征(颜色、形状、空间关系)不是人写进去的,而是模型根据任务需求自动学习得到的。 你只需给几千张“西红柿炒鸡蛋”的原始图片即可。
4.5 数学本质:函数的“套娃”
深度学习的数学本质非常形象——函数的嵌套(套娃结构):
- 第一层隐藏层:
h₁ = f₁(x) - 第二层隐藏层:
h₂ = f₂(h₁) - ……
- 最终输出:
Y = f(...f(f(x))...)
每一层的输出作为下一层的输入,一层一层套起来。
4.6 为什么叫“深度”和“隐藏层”?
- 隐藏层:除了输入层和输出层,中间层的特征对人眼不可见;当参数达到数十亿级别时,人类根本难以解释某一层的具体含义,所以叫“隐藏”。
- 深度:指网络层数极多。GPT-3有96层,GPT-4达到了120层,包含百亿级参数。层数多、参数多,所以叫“深度”学习。
五、生成式AI(Generative AI,简称:GenAI):从“分析世界”到“创造世界”
5.1 概念与定位
**生成式人工智能(Generative AI, GenAI)**全称应为 Generative AI,是AI的一个分支。截至目前,所有的GenAI都基于深度学习完成。
它与传统AI的核心区别在于任务重心:
| 维度 | 传统AI | 生成式AI |
|---|---|---|
| 核心重心 | 分析(Analyze) | 生成(Generate) |
| 典型任务 | 图像分类、用户画像、数据预测 | 写作文、画画、生成视频 |
| 角色比喻 | 分析者 | 创作者、造物主 |
老师把这次转变称为质的跨越:
过去我们拿数据做分析(NLP(Natural Language Processing,自然语言处理)、CV(Computer Vision,计算机视觉)本质上都是分析);现在你给AI一个目标,它直接给你创造出一个从未存在过的结果。
5.2 工作原理:成语接龙与概率采样
GenAI到底是怎么“创作”的?老师给出的核心机制非常通俗:它是一个基于概率列表的随机抽奖过程,就像成语接龙,逐字生成。
以句子**“今天天气真____”**为例:
-
模型内部计算出一个候选词概率列表:
- “好” → 45%
- “不” → 20%
- “热” → 15%
- “冷” → 10%
-
第一次采样:模型像“摇骰子”一样随机抽取。如果命中45%,就输出“好”,句子变成“今天天气真好”。
-
动态迭代:如果第一次抽中的是“不”,句子变成“今天天气真不”。此时上下文已改变,模型会重新计算所有候选词的概率分布(概率表已刷新),再进行下一次采样。
-
如此循环往复,一个字接一个字,最终连成完整文章。
老师总结:GenAI的工作过程就是一个连续的、基于上下文动态调整概率的“接龙”过程。它标志着AI从“分析世界”跨越到了“创造世界”。
六、大语言模型(Large Language Model,简称:LLM):生成式AI的集大成者
6.1 定义与“大”的三大含义
大语言模型(Large Language Model, LLM)是人工智能领域的核心突破。它是一种通过海量文本训练而成、拥有巨量参数、能够理解和生成人类语言的概率模型(即前面说的“接龙/掷骰子”机制)。
这里的“大”体现在三个维度:
① 数据大
- GPT-3(2020年)原始数据达45TB,清洗后有效数据约570GB。
- DeepSeek V3使用了14.8万亿Token的数据量。
② 参数大
- GPT-3参数量达到1750亿(175 Billion)。
- 截至2024年,部分模型参数量已达670亿甚至更高。
③ 算力大
- GPT-4训练使用了2万多张高端显卡(如NVIDIA A100),单卡显存至少40GB。
- 训练电费就烧掉了数千万美金。
- 模型权重文件动辄几百GB,普通消费级显卡(6GB/8GB显存)根本无法加载。
6.2 能理解,更能精准生成
老师用大语言模型的“听话”能力,解释了什么叫“理解与生成”:
你让它写一篇关于“春天”的作文,它不会写成冬天;你让它写500字,它会生成500字左右;你让它写800字,它也能生成800字左右。它能精准响应主题与格式要求,而非输出固定长度的无关内容。
6.3 三大主流架构
目前大模型主要分为三类:
- Decoder-only(仅解码器):擅长内容生成。代表:GPT系列、DeepSeek系列。
- Encoder-only(仅编码器):擅长完形填空、情感分类等理解类任务。代表:BERT。
- Encoder-Decoder(编码器-解码器组合):常用于机器翻译等序列到序列任务。代表:T5。
老师提醒我们:BERT虽然也是大语言模型,但它严格来说更偏向“完形填空”式的理解,而非生成全新内容;不过在实际应用和面试中,把大语言模型归为生式AI或AI的分支都是被广泛接受的。
七、一张图理清五者关系
课程最后,老师带我们回顾了这五个词的完整层级:
- 人工智能(AI):终极目标——让机器具备人类智能。
- 机器学习(ML):实现AI最重要的方法——自动化寻找数据间
x与y的关系(出租车计费那个例子)。 - 深度学习(DL):机器学习最热门的分支——取消人工特征工程,直接拿原始数据训练(西红柿炒鸡蛋那个例子)。
- 生成式AI(GenAI):基于深度学习构建——从分析转向创造,按用户要求生成全新内容(写作文、画图、生成视频)。
- 大语言模型(LLM):生成式AI的核心载体——数据大、参数大、算力大,真正理解并生成人类语言。
结语
如果你依然觉得这些概念很抽象,老师给了一句最通俗的总结:
人工智能的本质,始终是让机器像人一样进行思考、决策和行动。
如果你还不理解,就想象一下问界汽车过斑马线的那个例子——它用雷达和摄像头“看”到老人,用大脑“决定”停车,用刹车和油门“执行”动作。
而现在,从最底层的感知,到生成一篇800字的春天作文,AI已经走完了从“感知世界”到“创造世界”的完整跃迁。
更多推荐



所有评论(0)