1. 深度学习 - 入门
1.深度学习 - 入门
1)是什么
深度学习是机器学习的一个子领域,主要基于人工神经网络(尤其是多层神经网络)来模拟人脑处理信息的方式。它通过大量数据训练模型,自动提取特征并进行预测或决策。深度学习的核心在于“深度”——即网络包含多个隐藏层,能够学习到数据中复杂的非线性关系。
✅ 小结:深度学习利用多层神经网络从数据中自动学习复杂特征,是实现端到端智能建模的关键技术。
2)为什么
深度学习之所以重要,是因为它在处理大规模、高维度数据(如图像、语音、文本)方面表现出色。传统机器学习方法依赖人工特征工程,而深度学习可以端到端地自动学习特征,显著提升了性能。此外,随着计算能力(GPU/TPU)、大数据和算法进步,深度学习成为人工智能发展的核心技术。
✅ 小结:深度学习因自动特征提取、高性能表现及算力支持,成为现代AI突破的核心驱动力。
3)什么时候用
- 处理图像识别、目标检测、人脸识别等视觉任务(使用CNN)
- 处理序列数据,如自然语言处理(NLP)、语音识别、时间序列预测(使用RNN、LSTM、Transformer)
- 生成式任务,如图像生成、文本生成(使用扩散模型、GAN、Transformer)
- 需要复杂模式识别与高精度预测的任务
- 数据量大且标注充足时
✅ 小结:当任务涉及高维、复杂数据且拥有充足标注数据时,深度学习是最优选择。
4)什么时候不用
- 数据量小(深度学习需要大量数据训练)
- 问题简单,可用传统方法解决(如线性回归、决策树)
- 实时性要求极高,且资源受限(深度学习模型通常较慢、占内存多)
- 解释性要求高(深度学习为黑箱模型,难以解释)
- 缺乏标注数据(无监督或半监督场景可能不适用)
✅ 小结:在数据少、资源紧、可解释性强或问题简单的情况下,应优先考虑传统机器学习方法。
5)总结
深度学习是当前人工智能的重要支柱,尤其在感知类任务中表现卓越。它通过深度神经网络实现自动特征学习,推动了计算机视觉、自然语言处理等多个领域的突破。但其对数据、算力和调参的要求较高,需结合具体场景合理选择。
概念
1.1 常见的深度学习模型
全连接神经网络(DNN / MLP)
卷积神经网络(CNN)
循环神经网络(RNN)
Diffusion(扩散模型)
Transformer(当前主流架构)
深度强化学习(Deep Reinforcement Learning, DRL)
图神经网络(GNN, Graph Neural Network)
1.2 应用场景
CNN-计算机视觉
RNN-NLP自然语言处理
DNN-结构化的数据处理(例如房价、股价的预测)
Transformer- NLP领域,cv领域,AIGC
Diffusion-视频生成的主流框架
1.3 ANN:人工神经网络(一切的起点)
想象你有一个“智能小盒子”,它能根据输入(比如一张照片)猜出答案(比如“这是猫”)。这个盒子就是人工神经网络(Artificial Neural Network, ANN)。
- 它最早模仿人脑神经元工作方式:接收信号 → 处理 → 输出。
- 最简单的 ANN 叫 多层感知机(MLP):
- 输入层(比如像素值)→ 隐藏层(中间计算)→ 输出层(比如“猫/狗”)
- 虽然现在有更高级的模型,但 所有深度学习模型都是 ANN 的“升级版”!
✅ 小结:ANN 就是 AI 的“基础款大脑”,由多层“计算单元”组成,能从数据中学习规律。它是 CNN、RNN、Transformer 的老祖宗。
1.4 CNN:专治“看图说话”的高手
如果你让普通 ANN 看一张高清图(比如 1000×1000 像素),它会直接“死机”——参数太多,算不动!
于是人们发明了 CNN(卷积神经网络):
- 它像一个“滑动放大镜”,只看图片的一小块(比如眼睛、耳朵),找局部特征;
- 再一层层组合,最后认出整张脸;
- 还会“压缩信息”(池化),省电又高效。
✅ 小结:CNN 是图像识别的王者,靠“局部观察 + 层层抽象”搞定照片、视频,手机人脸解锁就靠它!
1.5 RNN:会“记住过去”的讲故事者
普通网络看一句话,每个词是孤立的。但人类理解语言要看上下文!
RNN(循环神经网络) 就像有个“小本本”:
- 读到第3个词时,还记得前2个词说了啥;
- 适合处理有顺序的数据:句子、语音、股票走势;
- 后来升级成 LSTM / GRU,记性更好,不怕“忘掉开头”。
✅ 小结:RNN 是时间序列和文本任务的老将,擅长“边读边记”,虽然现在被 Transformer 抢风头,但在某些场景依然好用。
1.6 Transformer:注意力大师,全能选手
以前模型要么看局部(CNN),要么按顺序读(RNN),效率低。
Transformer 说:“我不需要顺序!我一眼扫完整句话,靠‘注意力’决定哪些词更重要。”
- 比如翻译 “I love cats” → “我爱猫”,它知道 “love” 和 “爱” 要对齐;
- 不仅用于文字(GPT、BERT),还能处理图像(ViT)、音频;
- 是现在大模型(如 ChatGPT)的核心引擎。
✅ 小结:Transformer 凭借“全局视野 + 注意力机制”,成了 AI 界的六边形战士,NLP 和 CV 通吃!
1.7 Diffusion:AI 画家的秘密武器
想让 AI 画一张“穿西装的柴犬”?传统方法容易糊成一团。
扩散模型(Diffusion) 的思路很有趣:
- 先给一张图疯狂加噪,变成雪花屏;
- 再训练 AI 学会“一步步去噪”,从乱码还原成清晰图;
- 生成时反过来:从纯噪声开始,慢慢“画”出图像。
Stable Diffusion、DALL·E 2 都用这招,画质超清!
✅ 小结:Diffusion 像个耐心的修复师,通过“加噪→去噪”过程生成逼真图像,是当前 AIGC 的主流技术。
1.8 GNN:专治“关系户”的专家
有些数据不是表格,也不是句子,而是关系网:
-
微信好友圈
-
分子结构(原子怎么连)
-
商品推荐(你买A,朋友买B)
图神经网络(GNN) 就是为这种“点+连线”结构设计的: -
每个节点(人/原子)会收集邻居的信息;
-
一层层传播,最终理解整个网络。
✅ 小结:GNN 擅长处理“谁和谁有关”的问题,在社交、化学、推荐系统中大显身手。
1.9 深度学习 vs 传统机器学习:到底差在哪?
| 对比项 | 传统机器学习(如决策树) | 深度学习(如 CNN) |
|---|---|---|
| 特征怎么来? | 人手动设计(比如“平均点击率”) | 模型自己学(自动找边缘、纹理) |
| 数据要多少? | 几百条就够 | 动辄几万、百万条 |
| 电脑要多强? | 普通笔记本就行 | 最好有 GPU(显卡) |
| 能解释吗? | 能!比如“因为年龄>30,所以拒贷” | 难!像一个黑箱 |
| 适合干啥? | 结构化数据(Excel 表格) | 图像、语音、文本等复杂数据 |
✅ 小结:深度学习是“大力出奇迹”——数据多、算力强,效果好,但不好解释;传统 ML 更透明、轻量,适合小数据场景。
1.10 PyTorch:AI 工程师的乐高积木
- 它是一个写 AI 模型的工具(框架);
- 优点:灵活、调试方便、社区强大;
- 你可以用它轻松拼出 CNN、RNN、Transformer……就像搭乐高;
- 研究员最爱它,因为它“想怎么改就怎么改”。
✅ 小结:PyTorch 是目前最流行的深度学习工具之一,上手快、生态好,是入坑 AI 的首选。
1.11 总结
✅ ANN 是起点,CNN 看图,RNN 记事,Transformer 全能,Diffusion 画画,GNN 理关系——它们都是“会学习的程序”,而深度学习就是让它们越来越聪明的方法。
1.12 发展史
- 1943年:人工神经元模型提出
- 1980s:反向传播算法奠定训练基础
- 1990s:LeNet-5 成功应用于手写识别
- 2006年:Hinton 提出深度信念网络,开启深度学习热潮
- 2012年:AlexNet 爆发,CNN 主导计算机视觉
- 2014年:GAN 推动生成模型发展
- 2017年:Transformer 革命 NLP
- 2020年后:大模型与扩散模型引领 AIGC 时代
更多推荐
所有评论(0)