上篇我们说到,深度学习说白了就是“用多层神经网络自动学特征”,它的出现是因为传统机器学习被“手工设计特征”这个瓶颈卡了太久。但“多层神经网络”其实是一个大家族。就像一个家族里有搞数学的、有搞艺术的、有搞体育的,虽然都姓“深度”,但擅长的领域各不相同。

这一篇,我们就来聊聊深度学习到底有哪些类型,以及它今天到底能干哪些事。

一、有哪些类型?——深度学习的“四大门派”
深度学习的类型,可以从两个维度来看:一是网络结构(长得什么样),二是训练方式(怎么学的)。咱们先看网络结构,这是最直观的分类。

1. 全连接网络(DNN / MLP)——最基础的“万金油”
全连接网络(也叫多层感知机,MLP)是所有深度学习模型的基础。它的特点是:每一层的每个神经元,都和上一层的所有神经元相连。

这种结构最“老实”——它不假设数据有什么特殊结构,纯粹靠堆层数和神经元数量来拟合复杂的函数。但它的缺点也很明显:参数太多,而且会把数据中的空间结构(比如图像里像素的相对位置)忽略掉。所以它一般用在表格数据、简单分类任务上,或者作为其他复杂网络的“最后几层”。

2. 卷积神经网络(CNN)——图像领域的“霸主”
上两篇我们专门聊过CNN,这里简单提一句:它是专门为处理空间结构数据(如图像)设计的。通过“局部连接”和“权值共享”,它既能提取图像的边缘、纹理、物体部件等层级特征,又比全连接网络高效得多。

今天你手机里的人脸解锁、相册里的人物识别、拍照识图,背后几乎都是CNN。

3. 循环神经网络(RNN)与长短期记忆网络(LSTM)——序列数据的“老前辈”
如果说CNN是看图的,那RNN就是“听故事”的。它专门处理序列数据——比如一句话(文字是一个接一个的)、一段语音(音频信号是一帧一帧的)、一段股价(每天一个点)。

RNN的特点是“有记忆”:它在处理当前输入时,会把之前的信息带过来一起考虑。但早期的RNN有个问题:记忆太短,句子稍微长一点,前面的信息就“消失”了(这叫“梯度消失”)。

后来有了LSTM(长短期记忆网络)和GRU(门控循环单元),它们通过“门”结构来控制哪些信息要记住、哪些要忘掉,能处理几百个甚至上千个时间步的序列。在Transformer出现之前,LSTM是机器翻译、语音识别、文本生成这些任务的主力。

4. Transformer——当下的“全能王者”
2017年,谷歌的一篇论文《Attention Is All You Need》提出了Transformer架构。它的核心思想是“自注意力机制”——让序列里的每个位置都能直接“看到”所有其他位置,而不是像RNN那样一个一个往后传。

这个设计带来了几个巨大的好处:

并行计算:RNN必须一个一个算,Transformer可以一口气把所有位置都算完,训练速度快得多。

长距离依赖:不管两个词隔得多远,Transformer都能直接建立关联,不像RNN那样信息会衰减。

Transformer最初是为自然语言处理(NLP)设计的,但后来大家发现,它不仅能处理文字,还能处理图像(Vision Transformer,ViT)、语音、视频,甚至蛋白质序列、代码。今天你用的ChatGPT、文心一言、Gemini,底层全是Transformer。

可以说,Transformer是深度学习诞生以来,通用性最强的架构。

除了结构,还有训练方式
深度学习的“类型”,除了看网络长什么样,还可以看它是怎么“学”的。

监督学习:最经典的玩法。给模型一堆“问题+答案”(比如图片+“猫”这个标签),让它学会从问题预测答案。大多数图像识别、语音识别都属于这一类。

无监督学习:只给模型“问题”,不给“答案”,让它自己发现数据里的结构。比如聚类、降维、异常检测。虽然“无监督学习”这个词听起来没有“深度学习”那么火,但它其实是深度学习里非常核心的一支——毕竟现实世界中,带标签的数据永远是少数,没标签的数据才是汪洋大海。

自监督学习:这几年特别火。它把“无监督”和“监督”结合起来了——让模型从数据里自己“造”出标签。比如给模型一段文本,遮掉几个词,让它去猜被遮掉的词是什么。GPT系列就是这么训练的。这种方法让模型可以在海量无标签数据上先“预训练”,然后再用少量有标签数据“微调”,效果惊人。

强化学习:让模型在一个环境里不断试错,根据“奖励”信号来学习。下围棋的AlphaGo、自动驾驶的决策控制、游戏AI,都是强化学习的典型应用。

二、有什么作用?——它早已不是“实验室里的玩具”
聊完类型,我们来看看深度学习到底能干什么。说实话,今天只要你用智能手机、上网、点外卖、打车,你就已经在和深度学习打交道了。

1. 计算机视觉(让机器“看”):

人脸识别(手机解锁、机场安检)

物体检测(自动驾驶识别车和人、安防监控)

图像分割(医学影像里标出肿瘤边界)

图像生成(你用的美颜、老照片修复、AI绘画)

2. 自然语言处理(让机器“读”和“写”):

机器翻译(谷歌翻译、DeepL)

文本生成(你用的ChatGPT、写邮件助手)

情感分析(电商评论自动判断好评差评)

智能客服(你找电商客服时,对面可能是个AI)

3. 语音技术(让机器“听”和“说”):

语音识别(你对着手机说“打电话给妈妈”)

语音合成(导航里的语音播报、有声读物)

说话人识别(智能音箱认出是谁在说话)

4. 推荐系统(让机器“猜你喜欢”):

短视频推荐(抖音、快手)

电商推荐(淘宝、京东“猜你喜欢”)

内容推荐(Netflix、Spotify给你推剧推歌)

5. 科学发现与工程:

蛋白质结构预测:DeepMind的AlphaFold用深度学习预测了几乎所有已知蛋白质的结构,这是生物学领域几十年来的重大突破。

药物研发:用深度学习筛选分子,加速新药研发。

天气预报:用深度学习做短时临近预报(比如未来两小时会不会下雨),比传统数值方法更快。

材料科学:预测新材料的性质,加速材料研发。

6. 自动驾驶:

感知层(识别车道线、行人、交通标志)

决策层(规划路径、决策何时变道)

控制层(转向、加速、刹车的具体操作)
——每一层都有深度学习的身影。

7. 创意与内容生产:

AI绘画(Midjourney、Stable Diffusion)

AI写作(帮你写文案、写代码、写邮件)

AI作曲(生成背景音乐)

AI视频生成(Sora这类模型,输入文字就能生成视频)

写在最后:它不是终点,而是一个新的起点
深度学习走到今天,不过短短十来年的时间,却已经彻底改变了人工智能的图景。从最初“只有少数几个实验室在玩”的技术,变成了今天“全球科技公司都在押注”的基础设施。

但深度学习也不是万能的。它依赖大量数据,有时候像个“黑箱”——你能看到它给出了正确答案,却说不清它为什么这么判断。它在逻辑推理、因果推断、常识理解这些方面,还远不如一个普通成年人。

所以,与其把深度学习看作人工智能的“终点”,不如把它看作一个“起点”——它证明了“从数据中自动学习特征”这条路是走得通的,而且潜力巨大。未来的AI,可能会把深度学习和其他技术(比如符号推理、知识图谱)结合起来,走向一个更强大、也更可解释的方向。

但无论如何,今天我们聊到的这些——卷积神经网络、Transformer、自监督学习、强化学习——都是这条路上重要的里程碑。

更多推荐