机器学习入门基础(精华)
机器学习是人工智能的基础:含回归、分类、聚类、神经网络、文本和图像分析、深度学习。
第一章:
一、应用领域:自然语言处理、量化、视觉等
简介:即程序可以对外部反馈信息自动更新数据、能增加程序经验自我完善
基础:梳理统计、数学、改了线代、优化、等
核心元素:算法、数据、模型
基础条件:云计算和GPU并行计算为深度学习的发展提供基本保证
问题:机器学习应用邻域发展已经从广度发展到深度,对模型和训练有更高的要求。
五大流派:符号主义、贝叶斯、联结主义、进化主义、行为类推
符号主义:利用符号表达知识用规则进行逻辑推理
贝叶斯:事件b发生适合事件a发生的概率
联结主义:神经网络;加权计算加偏置值输出。
进化算法:迭代优化,适者生存
遗传算法;根据具体情况选择算法
行为类比:通过类比推理获取知识理论
数据挖掘:处理数据促进决策
机器学习:机器模仿人类学习知识
人工智能:机器学习和推理形成智能行为
与人相似功能:感知、语言、思维、学习、动作
典型人工智能系统:博弈、控制、翻译、语音、视觉、语言处理
数据挖掘任务:异常检测、关联分析、聚类、分类、回归
异常检测:不符合预期的事件
关联性规则学学习:发现变量间关系
聚类:划分数据为群集或子集
分类:由样本特征重新归类
回归:了解变量之间相关性
例如:广告公司对浏览、访问、点击、购买、评论等数据处理。
二、机器学习、人工智能与数据挖掘关系
挖掘:从数据中挖掘隐藏有用正确的知识促成决策。即物质决定意识。
案例:online在线模型分支一金融预测。重要变量政府、企业、宣传、大众(组织架构、决策机构、决策人员、遵循的核心理念、核心信息输入、下属机构组织的影响因子、反馈路径)输出。多个变量的交织和及反馈。(核心模型,各个变量以获取金币为核心:底层代码。并进行破产判断)
银行数据分析、各大银行流入流出现金流模型。
谷歌(Google)公司的PlaNet神经网络模型可以识别照片中的地理位置
自然语言处理:分词、词性标注、句法分析、自然语言、文本分类、信息检索、信息抽取、文本校对、问答系统、机器翻译、自动摘要。
分词:单词识别,使用匹配方法。
词性标注:单词词性进行分类和判断
句法分析:扩展原始上下文对比
自然语言生成:摘录。得语言者得天下。
自然语言处理文本分类:应用自动化分类技术
信息检索:向量空间模型,权重计算、词项权重计算。
四、机器学学习算法分类:监督学习、非监督学习、半监督学习
机器学习的分类算法包括:决策树,支持向量机(SupportVectorMachine,SVM),最近邻(K-NearestNeighbor,KNN)算法,贝叶斯网络(BayesNetwork)和神经网络等算法。
分类算法:神经网络、贝叶斯网络、最近邻近算发、决策树、支持向量机
聚类算法:BIRCH算法、CURE算法、K均值算法、DBSCAN算法、OPTICS算法
关联分析:Aprion算法、FPgorwth算法、Eclat算法
回归分析:线性回归、逻辑回归、多项式回归、岭回归、LASSO回归、
深度学习:
五、机器学习一般流程
1.定义目标(明确需求),才能选择现有数据与模型。2.收集数据。有代表有平衡有量级。3.整理预处理。探索数据并整理建模。4.数据建模。选择匹配模型。5.模型训练。6.模型评估。
学习python常用库
统计学:Numpy提供高效数组操作和数学函数
大数据与统计学:提供高效数据结构和函数。
Pandas:数据包分析为时间序列提供很好支持。
Matplotlib:强大数据可视化工具。与numpy无缝集成。
Scikit-learn:开源机器学习库。
数据降维与超参数调优:
-
设计结构
-
引言/核心思想:打破“魔法”的迷思。与常规编程对比(显式规则 vs 隐式模式)。
-
第1部分:课程地图(三大范式) -> 监督、无监督、强化。
-
第2部分:核心管道(工作流程) -> 数据准备、特征提取、模型选择、训练。
-
第3部分:核心数学引擎(“如何学习”) -> 损失函数 + 梯度下降(解释动量/步长)。
-
第4部分:关键挑战(泛化) -> 过拟合与欠拟合(这是CS/AI课程的标志)。
-
第5部分:现代前沿(深度学习/神经网络) -> 连接主义视图。
-
结论:针对非CS专业的实用建议(如何学习,不陷入数学困境)。
-
2.期末复习脉络
第1周:导论(什么是ML,监督/无监督/强化)
第2-3周:数学基础(线性代数回顾、概率论、最优化基础)
第4-5周:线性模型(线性回归 → 逻辑回归 → 多分类Softmax)
第6周:决策树与集成学习(ID3/CART → Random Forest → XGBoost)
第7周:支持向量机(硬间隔 → 软间隔 → 核函数)
第8周:无监督学习(K-Means → PCA → EM算法)
第9-10周:神经网络基础(感知机 → MLP → BP算法 → CNN基础)
第11周:模型评估与调参(交叉验证 → 超参搜索 → 评估指标)
第12周:综合实战(Kaggle入门 / 课程大作业)
3.学习建议
-
不要只调包,手推一次BP算法。理解链式法则在计算图上的反向传播,比背100个API有用。
-
Kaggle入门赛选一个做完。Titanic或House Prices,完整走一遍EDA → 特征工程 → 模型 → 调参 → 提交。
-
深度学习先不急,先把传统机器学习打扎实。面试高频:SVM的核函数、XGBoost的增益计算公式、逻辑回归的损失函数为什么要用Cross-Entropy而不是MSE。
-
一定要自己从零写一个Mini-Batch Gradient Descent框架。NumPy手写线性回归/逻辑回归的全流程,这是理解训练机制的最短路径。
-
分清"调参侠"和"懂原理的人"的区别:面试官一定会问"为什么Adam比SGD好"、"学习率过大/过小分别看到什么现象"这类问题。
更多推荐
所有评论(0)