很多人一上来就问:GPT是不是AI?DeepSeek是不是AI?

这些其实都是AI的应用。要真正理解AI,需要搞清楚整个技术谱系。


AI技术谱系:四层结构

AI(大概念)
 └── 机器学习(AI的子集)
      └── 深度学习(机器学习的子集)
           ├── 判别式模型
           └── 生成式模型
                └── 大语言模型(GPT、Claude等)

类比理解

假设AI是一个医学系统:

层级类比
AI整个医学系统
机器学习内科
深度学习心血管科
大语言模型心血管科某个专业医生

千万别把AI和ChatGPT画等号。


第一层:机器学习

核心能力

  • 模式识别
  • 泛化能力(在没见过的数据上表现良好)

三种学习方式

类型特点应用
监督学习有标注数据图像分类、语音识别、价格预测
无监督学习无标注数据用户分群、异常检测
半监督学习少量标注+大量无标注医学影像(标注困难但重要)

第二层:深度学习

与传统机器学习的区别

传统机器学习深度学习
特征工程+传统模型特征自动提取+深度神经网络
需要人工设计特征网络自动学习特征

神经网络结构

输入层 → 隐藏层(多层) → 输出层

本质:一个多层的非线性函数,用来逼近现实分布。

核心组件

组件作用
权重(Weight)连接强度
偏置(Bias)阈值调节
激活函数引入非线性

第三层:判别式 vs 生成式模型

核心区别

类型关注点数学表示
判别式模型边界P(Y
生成式模型分布P(X,Y)

对比

维度判别式模型生成式模型
代表逻辑回归、决策树、SVMGPT、VAE、扩散模型
任务分类、识别文本生成、图像生成
特点训练快、准确度高训练慢、能创造内容
生成能力几乎为零核心能力

第四层:生成式模型的四种架构

1. 自回归模型(GPT)

原理:一步步预测下一个Token

优点缺点
文本生成流畅难以并行,推理慢

2. 自编码器/变分自编码器(VAE)

原理:编码器压缩特征,解码器还原

应用特点
图像生成、视频生成引入概率建模,生成多样性

3. 扩散模型(Diffusion)

原理:从一堆噪声逐步采样得到清晰图像

优点缺点
图像质量极高生成较慢

代表:Midjourney、Stable Diffusion

4. 生成对抗网络(GAN)

原理:生成器造假数据,判别器判断真假

优点缺点
生成多样性极强训练不稳定

大语言模型(LLM)

代表模型

  • GPT系列(OpenAI)
  • Claude(Anthropic)
  • DeepSeek
  • 通义千问、文心一言

底层架构

所有大语言模型的底层都是Transformer

训练阶段

阶段目的数据
预训练学习基础能力海量无标注数据
微调适应特定任务子任务数据集
人类偏好对齐提升安全性和可控性人类反馈数据

Transformer的核心模块

模块作用
自注意力理解上下文关系
多头注意力从多个角度关注信息
前馈神经网络非线性变换
残差连接加速训练
层归一化稳定训练

生成式AI的落地场景

场景代表产品
文生文GPT、Claude、DeepSeek
文生图Midjourney、DALL-E、即梦
文生视频Sora、可灵、Runway
文生3DTripo等
文生代码GitHub Copilot、Cursor

共同点

看起来是不同的任务,但本质上都是Transformer + 不同模态的预处理


AI发展的时间线

年份里程碑
1950s图灵提出"机器能否思考"
1956"人工智能"术语诞生
1969神经网络局限被揭示,第一次寒冬
1986反向传播算法提出
2012AlexNet横空出世,深度学习爆发
2016AlphaGo战胜李世石
2017Transformer论文发表
2022ChatGPT发布,AI进入大众视野
2025DeepSeek等开源模型崛起

常见问题

Q1:机器学习和深度学习有什么区别?

深度学习是机器学习的子集,使用多层神经网络自动学习特征。

Q2:为什么现在都在谈大模型?

大模型在参数量和训练数据达到一定规模后,会出现"涌现"能力——突然具备理解、推理等能力。

Q3:判别式和生成式哪个更好?

看用途。需要分类识别用判别式,需要创造内容用生成式。


一句话总结

AI包括机器学习,机器学习包括深度学习,深度学习靠的是多层神经网络。

大模型属于自回归模型,Transformer是它的底座。现在的AI已经进入多模态时代——既能生成文本,也能生成图像和视频。

更多推荐