上篇我们说到,机器学习的本质是让机器从数据里自己找规律,而不是靠人写规则。这一篇我们来看看,机器学习具体分成哪几类,每一类又是怎么解决实际问题的。


你可以把机器学习想象成三种不同的教学方式。每一种都有自己的脾气和适用场景。

第一种:监督学习——手把手地教
这是最常见、最基础的一种。

“监督”的意思是:你给机器的每一条数据,都带着标准答案。机器要做的事,就是学会“从输入到输出”的映射关系。

举个例子:

你给机器一堆邮件,每封都贴好标签:“垃圾”或“非垃圾”。

机器从中学习垃圾邮件的特征:包含“免费”“中奖”这些词,发件人是个乱码地址,等等。

学完之后,来了一封新邮件,机器就能判断:“这封大概率是垃圾。”

监督学习擅长解决两类问题:

1. 分类问题——输出是一个类别。

这是猫还是狗?

这封邮件是垃圾还是正常?

这个病人得的是A病还是B病?

2. 回归问题——输出是一个数值。

预测明天的房价是多少。

预测下个月的销量是多少。

生活中你接触到的绝大多数AI应用,背后都是监督学习:人脸识别、语音识别、信用评分、推荐系统(的一部分)……都属于这一类。

第二种:无监督学习——自己摸索着学
这种就更“野”一点了——只给数据,不给答案。让机器自己去发现数据里隐藏的结构、规律或者模式。

还是举例子:

你给机器一千个顾客的数据,包括年龄、消费记录、浏览习惯,但不说这些顾客属于哪一类。

机器自己分析,发现有些顾客购物时间集中、买的都是母婴用品,另一些顾客深夜下单、买的都是电子产品。

机器自己把这些顾客分成了几个群组——虽然它不知道这些群组叫什么名字,但它发现了“这些人是一类”。

无监督学习最常见的用途是:

1. 聚类——把相似的东西自动归到一起。

电商用它来给用户分群,做精细化运营。

新闻网站用它把相似的文章自动聚合到一起,不需要人工分类。

2. 降维——把复杂的数据简化,但保留最重要的信息。

几百个维度的数据,压缩成两三个维度,方便可视化和理解。

这种学习方式的厉害之处在于:它能看到人没告诉它的事,甚至能看到人没意识到的事。

第三种:强化学习——在试错中成长
这种方式最像“驯狗”——做对了给奖励,做错了没奖励,让它自己摸索出怎样才能拿到最多奖励。

强化学习里有一个“智能体”(Agent)和一个“环境”(Environment)。智能体在环境里做动作,环境根据动作的好坏给它一个“奖励分数”。智能体的目标只有一个:想尽办法,让总奖励最大化。

最经典的例子是AlphaGo。

它一开始啥也不会,就在棋盘上乱下。

赢了(或者模拟的评估认为这一步好),就得到一个正反馈。

输了,得到负反馈。

它自己和自己下了无数盘棋,每一步都在调整策略,最终学会了人类从来没想过的下法。

强化学习的典型应用场景:(1)游戏AI(从Atari到围棋到星际争霸);(2)机器人控制(让机器人学会走路、抓取物体);(3)自动驾驶(在模拟环境里不断试错);(4)资源调度(比如数据中心节能,通过调整空调和服务器负载来最小化能耗)。

它和监督学习的最大区别是:监督学习是一次性给齐所有“标准答案”;强化学习没有标准答案,只有“这个动作好不好”,需要自己在探索中找最优解。

说了这么多,它到底有什么用?
机器学习不是实验室里关着门玩的东西。它已经渗透到你能想到的几乎所有领域了。

在互联网领域:

推荐系统——抖音、淘宝、Netflix,都是靠机器学习猜你喜欢什么。

搜索引擎——你打几个字,它能“理解”你想找什么,把最相关的结果排在最前面。

在医疗领域:

影像识别——AI看CT片子,识别早期肺癌,准确率已经可以和资深放射科医生持平甚至更高。

药物研发——用机器学习筛选可能的分子结构,把新药研发周期从几年缩短到几个月。

在金融领域:

风控——判断一笔交易是不是盗刷,几毫秒内给出结果。

量化交易——从海量市场数据中发现交易信号,自动执行买卖。

在制造和物流:

预测性维护——通过设备传感器数据,提前预测“这台机器两周后可能会坏”,避免突然停机。

智能仓储——机器人自动分拣、规划最优路径。

甚至在你想象不到的地方:

农业——用无人机拍摄农田,机器学习判断哪块地缺水、哪块地有病虫害。

天文——从海量望远镜数据中自动发现新的天体。


为什么会出现机器学习?

因为世界太复杂了,复杂到人写不出所有规则;数据太多了,多到人看不过来;变化太快了,快到人追不上。

机器学习不是要取代人的智慧,它做的是另一件事——把人从“写规则”这种繁琐的、反人性的劳动中解放出来,让人去做那些真正需要创造力、判断力和同理心的事。

一个医生不用再花大量时间看片子,而是把更多精力放在和病人沟通、制定治疗方案上;
一个程序员不用再写死板的规则来处理各种边界情况,而是让模型自己去适应变化;
一个普通人,每天打开手机,看到的都是自己真正感兴趣的内容,而不是被一堆垃圾信息淹没。

这,才是机器学习真正想做的事。

更多推荐