1.深度学习 - 入门

1)是什么

深度学习是机器学习的一个子领域,主要基于人工神经网络(尤其是多层神经网络)来模拟人脑处理信息的方式。它通过大量数据训练模型,自动提取特征并进行预测或决策。深度学习的核心在于“深度”——即网络包含多个隐藏层,能够学习到数据中复杂的非线性关系。

✅ 小结:深度学习利用多层神经网络从数据中自动学习复杂特征,是实现端到端智能建模的关键技术。

2)为什么

深度学习之所以重要,是因为它在处理大规模、高维度数据(如图像、语音、文本)方面表现出色。传统机器学习方法依赖人工特征工程,而深度学习可以端到端地自动学习特征,显著提升了性能。此外,随着计算能力(GPU/TPU)、大数据和算法进步,深度学习成为人工智能发展的核心技术。

✅ 小结:深度学习因自动特征提取、高性能表现及算力支持,成为现代AI突破的核心驱动力。

3)什么时候用

  • 处理图像识别、目标检测、人脸识别等视觉任务(使用CNN)
  • 处理序列数据,如自然语言处理(NLP)、语音识别、时间序列预测(使用RNN、LSTM、Transformer)
  • 生成式任务,如图像生成、文本生成(使用扩散模型、GAN、Transformer)
  • 需要复杂模式识别与高精度预测的任务
  • 数据量大且标注充足时

✅ 小结:当任务涉及高维、复杂数据且拥有充足标注数据时,深度学习是最优选择。

4)什么时候不用

  • 数据量小(深度学习需要大量数据训练)
  • 问题简单,可用传统方法解决(如线性回归、决策树)
  • 实时性要求极高,且资源受限(深度学习模型通常较慢、占内存多)
  • 解释性要求高(深度学习为黑箱模型,难以解释)
  • 缺乏标注数据(无监督或半监督场景可能不适用)

✅ 小结:在数据少、资源紧、可解释性强或问题简单的情况下,应优先考虑传统机器学习方法。

5)总结

深度学习是当前人工智能的重要支柱,尤其在感知类任务中表现卓越。它通过深度神经网络实现自动特征学习,推动了计算机视觉、自然语言处理等多个领域的突破。但其对数据、算力和调参的要求较高,需结合具体场景合理选择。


概念

1.1 常见的深度学习模型

全连接神经网络(DNN / MLP)
卷积神经网络(CNN)
循环神经网络(RNN)
Diffusion(扩散模型)
Transformer(当前主流架构)
深度强化学习(Deep Reinforcement Learning, DRL)
图神经网络(GNN, Graph Neural Network)

1.2 应用场景

CNN-计算机视觉
RNN-NLP自然语言处理
DNN-结构化的数据处理(例如房价、股价的预测)
Transformer- NLP领域,cv领域,AIGC
Diffusion-视频生成的主流框架

1.3 ANN:人工神经网络(一切的起点)

想象你有一个“智能小盒子”,它能根据输入(比如一张照片)猜出答案(比如“这是猫”)。这个盒子就是人工神经网络(Artificial Neural Network, ANN)。

  • 它最早模仿人脑神经元工作方式:接收信号 → 处理 → 输出。
  • 最简单的 ANN 叫 多层感知机(MLP):
  • 输入层(比如像素值)→ 隐藏层(中间计算)→ 输出层(比如“猫/狗”)
  • 虽然现在有更高级的模型,但 所有深度学习模型都是 ANN 的“升级版”!

✅ 小结:ANN 就是 AI 的“基础款大脑”,由多层“计算单元”组成,能从数据中学习规律。它是 CNN、RNN、Transformer 的老祖宗。

1.4 CNN:专治“看图说话”的高手

如果你让普通 ANN 看一张高清图(比如 1000×1000 像素),它会直接“死机”——参数太多,算不动!

于是人们发明了 CNN(卷积神经网络)

  • 它像一个“滑动放大镜”,只看图片的一小块(比如眼睛、耳朵),找局部特征;
  • 再一层层组合,最后认出整张脸;
  • 还会“压缩信息”(池化),省电又高效。

✅ 小结:CNN 是图像识别的王者,靠“局部观察 + 层层抽象”搞定照片、视频,手机人脸解锁就靠它!

1.5 RNN:会“记住过去”的讲故事者

普通网络看一句话,每个词是孤立的。但人类理解语言要看上下文!

RNN(循环神经网络) 就像有个“小本本”:

  • 读到第3个词时,还记得前2个词说了啥;
  • 适合处理有顺序的数据:句子、语音、股票走势;
  • 后来升级成 LSTM / GRU,记性更好,不怕“忘掉开头”。

✅ 小结:RNN 是时间序列和文本任务的老将,擅长“边读边记”,虽然现在被 Transformer 抢风头,但在某些场景依然好用。

1.6 Transformer:注意力大师,全能选手

以前模型要么看局部(CNN),要么按顺序读(RNN),效率低。

Transformer 说:“我不需要顺序!我一眼扫完整句话,靠‘注意力’决定哪些词更重要。”

  • 比如翻译 “I love cats” → “我爱猫”,它知道 “love” 和 “爱” 要对齐;
  • 不仅用于文字(GPT、BERT),还能处理图像(ViT)、音频;
  • 是现在大模型(如 ChatGPT)的核心引擎。

✅ 小结:Transformer 凭借“全局视野 + 注意力机制”,成了 AI 界的六边形战士,NLP 和 CV 通吃!

1.7 Diffusion:AI 画家的秘密武器

想让 AI 画一张“穿西装的柴犬”?传统方法容易糊成一团。

扩散模型(Diffusion) 的思路很有趣:

  • 先给一张图疯狂加噪,变成雪花屏;
  • 再训练 AI 学会“一步步去噪”,从乱码还原成清晰图;
  • 生成时反过来:从纯噪声开始,慢慢“画”出图像。
    Stable Diffusion、DALL·E 2 都用这招,画质超清!

✅ 小结:Diffusion 像个耐心的修复师,通过“加噪→去噪”过程生成逼真图像,是当前 AIGC 的主流技术。

1.8 GNN:专治“关系户”的专家

有些数据不是表格,也不是句子,而是关系网:

  • 微信好友圈

  • 分子结构(原子怎么连)

  • 商品推荐(你买A,朋友买B)
    图神经网络(GNN) 就是为这种“点+连线”结构设计的:

  • 每个节点(人/原子)会收集邻居的信息;

  • 一层层传播,最终理解整个网络。

✅ 小结:GNN 擅长处理“谁和谁有关”的问题,在社交、化学、推荐系统中大显身手。

1.9 深度学习 vs 传统机器学习:到底差在哪?

对比项传统机器学习(如决策树)深度学习(如 CNN)
特征怎么来?人手动设计(比如“平均点击率”)模型自己学(自动找边缘、纹理)
数据要多少?几百条就够动辄几万、百万条
电脑要多强?普通笔记本就行最好有 GPU(显卡)
能解释吗?能!比如“因为年龄>30,所以拒贷”难!像一个黑箱
适合干啥?结构化数据(Excel 表格)图像、语音、文本等复杂数据

✅ 小结:深度学习是“大力出奇迹”——数据多、算力强,效果好,但不好解释;传统 ML 更透明、轻量,适合小数据场景。

1.10 PyTorch:AI 工程师的乐高积木

  • 它是一个写 AI 模型的工具(框架);
  • 优点:灵活、调试方便、社区强大;
  • 你可以用它轻松拼出 CNN、RNN、Transformer……就像搭乐高;
  • 研究员最爱它,因为它“想怎么改就怎么改”。

✅ 小结:PyTorch 是目前最流行的深度学习工具之一,上手快、生态好,是入坑 AI 的首选。

1.11 总结

✅ ANN 是起点,CNN 看图,RNN 记事,Transformer 全能,Diffusion 画画,GNN 理关系——它们都是“会学习的程序”,而深度学习就是让它们越来越聪明的方法。

1.12 发展史

  • 1943年:人工神经元模型提出
  • 1980s:反向传播算法奠定训练基础
  • 1990s:LeNet-5 成功应用于手写识别
  • 2006年:Hinton 提出深度信念网络,开启深度学习热潮
  • 2012年:AlexNet 爆发,CNN 主导计算机视觉
  • 2014年:GAN 推动生成模型发展
  • 2017年:Transformer 革命 NLP
  • 2020年后:大模型与扩散模型引领 AIGC 时代

更多推荐