1 AL,ML,DL

【知道】人工智能

- Artificial Intelligence  人工智能

是一个系统,像人那样思考 像人那样理性思考,像人那样活动 像人那样合理系统

【知道】机器学习

Machine Learning   释义:机器学习

让机器自动学习,而不是基于规则的编程(不依赖特定规则编程)

【知道】深度学习

深度学习(DL, Deep Learning) : ,也叫深度神经网络,大脑仿生,设计一层一层的神经元模拟万事万物

1.1 【知道】三者之间的关系

机器学习是实现人工智能的一种途径

深度学习是机器学习的一种方法

1.2【了解】学习方式

1【了解】基于规则的学习

•基于规则的预测 : 程序员根据经验利用手工的if-else方式进行预测

2【了解】基于模型的学习

基于模型的学习就是通过编写机器学习算法,让机器自己学习从历史数据中获得经验、训练模型

1.3【知道】机器学习发展三要素

数据、算法、算力三要素相互作用,是AI发展的基石

1.  CPU:负责调度任务、计算任务等;主要适合I\O密集型的任务
2.  GPU:更加适合矩阵运算;主要适合计算密集型任务
3.  TPU:Tensor,专门针对神经网络训练设计一款处理器

2 机器学习常见术语

2.1【掌握】样本,特征,标签/目标值

1 :样本(sample) :一行数据就是一个样本;多个样本组成数据集;有时一条样本被叫成一条记录

2 :特征(feature) :一列数据一个特征,有时也被称为属性

3 :标签/目标(label/target) :模型要预测的那一列数据。本场景是就业薪资

2.2 【掌握】数据集划分

数据集可划分两部分:训练集、测试集  比例:8 : 2,7 : 3 

训练集(training set) :用来训练模型(model)的数据集

测试集(testing set):用来测试模型的数据集

3 机器学习算法分类

3.1 【掌握】有监督学习

  • 定义:输入数据是由输入特征值和目标值所组成,即输入的训练数据有标签的

  • 数据集:需要人工标注数据

【掌握】分类

- 目标值(标签值)是不连续的

- 分类种类:二分类、多分类任务、

【掌握】回归

目标值(标签值)是连续的

3.2 【熟悉】无监督学习

- 定义:输入数据没有被标记,即样本数据类别未知,**没有标签**,根据样本间的相似性,对样本集聚类,以发现事物内部 结构及相互关系。

- 数据集:不需要标注数据

无监督学习特点:

 1 训练数据无标签

 2 根据样本间的相似性对样本集进行聚类,发现事物内部结构及相互关系

3.3 【了解】半监督学习

工作原理:

1 让专家标注少量数据,利用已经标记的数据(也就

  是带有类标签)训练出一个模型

2 再利用该模型去套用未标记的数据

3 通过询问领域专家分类结果与模型分类结果做对比,从而对模型做进一步改善和提高,半监督学习方式可大幅降低标记成本

3.4 【了解】强化学习

1 强化学习(Reinforcement Learning):机器学习的一个重要分支

2 应用场景:里程碑AlphaGo围棋、各类游戏、对抗比赛、无人驾驶场景

3 基本原理:基本原理:通过构建四个要素:agent,环境状态,行动,奖励,

 agent根据环境状态进行行动获得最多的累计奖励。

4【知道】机器学习的建模流程

5 特征工程

5.1 概念

从数据集角度来看:    一列一列的数据为特征。

从模型训练角度来看: 对预测结果有用的属性为特征

特征工程是:利用专业背景知识和技巧处理数据,让机器学习算法效果最好。这个过程就是特征工程

5.2 【理解】特征提取

从原始数据中提取与任务相关的特征,构成特征向量

5.3 【理解】特征预处理

特征对模型产生影响;因量纲问题,有些特征对模型影响大、有些影响小

将不同的单位的特征数据转换成同一个范围内

使训练数据中不同特征对模型产生较为一致的影响

5.4 【了解】特征降维

将原始数据的维度降低,叫做特征降维

会丢失部分信息。降维就需要保证数据的主要信息要保留下来

原始数据会发生变化,不需要了解数据本身是什么含义,它保留了最主要的信息

5.5 【了解】特征选择

原始数据特征很多,但是对任务相关是其中一个特征集合子集

从特征中选择出一些重要特征(选择就需要根据一些指标来选择)

特征选择不会改变原来的数据

5.6 【了解】特征组合

把多个的特征合并成一个特征。

通过加法、乘法等方法将特征值合并。

6 【掌握】模型拟合问题

1 :拟合:用来表示模型对样本点的拟合情况

2 :欠拟合:模型在训练集上表现很差、在测试集表现也很差

原因:模型过于简单

3 :过拟合:模型在训练集上表现很好、在测试集表现很差

原因:模型太过于复杂、数据不纯、训练数据太少

4 :泛化:模型在新数据集(非训练数据)上的表现好坏的能力

奥卡姆剃刀原则:给定两个具有相同泛化误差的模型,较简单的模型比较复杂的模型更可取

更多推荐