提示:文章写完后,目录可以自动生成,如何生成可参考右边的帮助文档


前言

给机器一张图片,它为什么能知道这是不是猫?人看到猫,基本一眼就能认出来。

但机器不一样。
在机器眼里,一张图片不是“猫”,而是一堆像素数字。
它不知道什么是耳朵,不知道什么是胡须,也不知道什么叫“猫脸”。

那问题来了:

  • 机器到底是怎么学会认猫的?

这个过程,其实就是深度学习最核心的思想。
对人来说,这是直觉。对机器来说,这其实是一个“从数据中学习规律,再完成分类判断”的过程。


在这里插入图片描述

不是人工把“猫长什么样”写成规则告诉机器,而是让机器从大量样本中自己学会规律

第一步:训练数据世界

“训练数据世界”,表示模型在正式识别之前,先要看大量训练样本。

这里放了大量猫和非猫的样本图片。
这部分想表达的是:

  • 深度学习不是凭空判断,它一定先要“见过大量样本”。

为什么必须有这么多图?
因为模型不是人,它没有生活经验。它不认识猫,也不理解“猫”这个词背后的现实含义。

所以训练的第一步,就是先喂给它大量已经标注好的样本:

  • 这张是猫
  • 这张不是猫
  • 这张也是猫
  • 这张也不是猫

样本越多,模型越有机会从中发现稳定规律。

换句话说:深度学习的起点,不是规则,而是数据这一点特别关键。

第二步:模型学习过程

看到这里,很多人会问:模型到底在“学”什么?

答案是:它学的不是“猫”这个汉字,也不是“这张图长得可爱所以是猫”。它学的是图片里的各种模式

比如:

  • 哪些边缘更常见
  • 哪些纹理更像毛发
  • 哪些局部区域更像耳朵
  • 哪些组合更像猫脸

也就是说,模型不是一下子学会“猫”这个整体概念,而是先从大量样本里慢慢学出:

哪些图像特征,更可能和“猫”有关。

所以这里的“学习”,不是人类背课文那种学习,
而是:从海量数据中提取规律

第三步:特征学习 + 多层提取

最关键的地方。因为它回答了一个非常核心的问题:为什么它叫“深度”学习?

答案就在这几个层次里。

第1层:先学简单特征

在比较前面的层里,模型通常不会直接学到“猫”。它先学到的是一些最基础的东西,比如:

  • 边缘
  • 线条
  • 纹理
  • 亮暗变化

这些东西本身不是“猫”,但它们是构成更复杂图像的基础。

第2层:再学局部形状

当这些简单特征往后继续组合,模型就开始学到更具体一点的局部结构,比如:

  • 眼睛
  • 耳朵
  • 胡须区域
  • 面部局部轮廓

这时候,模型已经不是只看一条线,而是在看:这些线条和纹理,组合起来像不像某种局部结构。

第3层:最后学整体模式

再往后,模型会继续把这些局部结构组合起来,变成更完整的模式,比如:

  • 猫脸轮廓
  • 头部整体结构
  • 身体形态
  • 完整的猫体轮廓

到了这一层,模型才更接近“认出猫”这件事。所以,所谓“深度”,本质上就是:

不是一层直接出答案,而是多层一步一步提取、组合、抽象。

这也是深度学习和传统简单规则最大的区别之一。

第四步:预测结果

这部分表达的是:模型训练完成后,就可以去判断一张它没见过的新图片

这一步很关键。
因为如果模型只能记住训练集里的图,那不叫真正学会,
那只叫“背题”。

真正的目标是:训练时看过大量样本,测试时面对全新图片,依然能判断出“这是猫”

这说明模型学到的不是某一张图,而是“猫”背后的模式规律

所以右边这部分,本质上对应的是两个字:预测

也就是:

模型用训练阶段学到的规律,去处理新的输入。


总结

最后压缩成一句话就是:

深度学习,不是人工告诉机器“猫长什么样”,而是让机器从大量猫和非猫图片中,自己学会判断规律。

更多推荐