机器学习概述
1. 机器学习的发展:人工智能中的机器学习
人工智能的演进历程中,不同技术流派对“智能实现路径”的探索形成了差异化方向,其中符号主义与基于机器学习的方法是两个关键阶段,二者的迭代反映了人工智能从“人工定义逻辑”到“数据自主学习”的核心转变。
1.1 符号主义人工智能
符号主义,又称逻辑主义、心理学派,是早期人工智能的主导流派,核心原理围绕物理符号系统假设与有限合理性原理展开,代表人物包括纽威尔、肖、西蒙等。该流派认为:人类认知与思维的基本单元是“符号”,认知过程本质是符号层面的运算——人作为物理符号系统,其智能行为可通过计算机的符号操作模拟,即“认知即计算”。
符号主义的技术实践以“人工编码规则”为核心:先由领域专家将知识抽象为可量化的符号与逻辑规则,再通过推理引擎执行“If-Then”逻辑实现问题求解。其典型成果包括1957年纽威尔与西蒙开发的“逻辑理论家”,以及20世纪80-90年代的专家系统,如医疗诊断系统MYCIN。
然而,符号主义存在显著局限性:一是“知识获取瓶颈”——复杂领域的规则难以穷尽,人工编码成本极高;二是“不确定性处理能力弱”——无法应对模糊场景;三是“泛化能力差”——规则仅适用于特定场景,难以适配动态变化的数据环境。这些缺陷使得符号主义逐渐被数据驱动的机器学习方法取代。
1.2 基于机器学习的人工智能
随着大型数据库、传感器技术与并行计算的发展,人工智能的研究重心转向“数据驱动”,而机器学习正是这一转变的核心技术支撑。其核心逻辑与符号主义截然不同:无需人工编写显式规则,而是通过算法让计算机从数据中自主学习规律,实现对复杂任务的智能处理。
机器学习的理论源头可追溯至1950年Alan Turing提出的“图灵测试”——该测试从理论上论证了“具备思考能力的机器”存在的可能性,为计算机拥有学习能力提供了基础。从编程范式来看,符号主义是“规则 + 数据→答案”的模式,而机器学习则是“数据 + 答案→规则”的反向过程:计算机通过分析大量标注数据,自动挖掘隐藏的“输入—输出”映射关系,这些“规则”往往无法通过人工编程提前定义,却能适配更复杂的场景。
20世纪90年代后,依托硬件算力提升与数据集规模扩大,机器学习进入快速发展期:2011年IBM的智能计算机“Watson”在问答节目《危险边缘》中击败人类冠军,其核心是通过DeepQA技术整合数百万份文本数据,借助100余套算法实现快速问题解析与答案检索;2016年谷歌DeepMind的“AlphaGo”击败世界围棋冠军李世石,标志着深度学习在复杂决策场景的突破——通过多层神经网络提取棋局特征,结合强化学习来优化落子策略,实现了对非线性问题的精准建模。
当前,以机器学习为核心的人工智能已具备接近人类水平的感知能力:图像识别可精准分类物体,语音识别能实时转写文字,机器翻译可覆盖数十种语言。这些技术已落地于智能家电、自动驾驶、虚拟客服等场景,改变了人们的生活方式。但需注意,现有AI仍存在“理解能力缺陷”—— 如Watson在处理自然语言时,难以领悟双关、反讽等修辞,无法真正理解文字含义;未来需在自然语言理解、情感分析等领域持续突破,推动AI从“感知智能”向“认知智能”演进。

图1 机器学习与传统编程范式对比图
2. 机器学习的核心:数据和数据建模
从编程范式角度看,机器学习的本质是通过“数据”与“答案”挖掘“规则”,而实现这一过程的核心是“数据”与“数据建模”——数据决定模型的知识边界,建模则决定数据价值的转化效率。1783年托马斯·贝叶斯提出的贝叶斯定理,从数学层面证明了“从历史数据中学习关联规则”的可行性,为机器学习的理论基础提供了支撑。
数据建模是描述数据关系、预测数据趋势的过程,通常包括数据收集、清理、预处理、模型构建、评估与应用六个步骤。在机器学习中,数据建模的核心目标是从大规模数据中发现 “有效、可理解、可泛化” 的规律,为实际问题提供解决方案。
2.1 机器学习的学习对象:数据集
机器学习的直接学习对象是数据集,又称样本集,其常见组织形式为二维表:表中每行代表一个“样本观测”,每列对应一个“变量”。数据集的质量直接决定模型性能,需满足“相关性、完整性、代表性”三大要求。
以北京市空气质量监测数据集(来源:中国空气质量在线监测分析平台https://www.aqistudy.cn)为例,其结构与变量特征如下表所示:
表1 北京市空气质量监测数据表(部分)
| 日期 | AQI | 质量等级 | PM2.5 (μg/m³) | PM10 (μg/m³) | SO₂ (μg/m³) | CO (mg/m³) | NO₂ (μg/m³) | O₃ (μg/m³) |
| 2019/1/1 | 45 | 优 | 28 | 45 | 8 | 0.7 | 34 | 47 |
| 2019/1/2 | 78 | 良 | 57 | 75 | 12 | 1.0 | 56 | 28 |
| 2019/1/3 | 162 | 中度污染 | 123 | 136 | 21 | 1.9 | 82 | 12 |
| 2019/1/4 | 40 | 优 | 18 | 40 | 5 | 0.5 | 26 | 61 |
| 2019/1/5 | 47 | 优 | 17 | 34 | 7 | 0.5 | 37 | 49 |
| 2019/1/6 | 88 | 良 | 64 | 95 | 12 | 1.4 | 70 | 13 |
| 2019/1/7 | 55 | 良 | 34 | 54 | 9 | 0.9 | 44 | 52 |
| 2019/1/8 | 35 | 优 | 10 | 29 | 4 | 0.5 | 28 | 62 |
| 2019/1/9 | 74 | 良 | 41 | 66 | 12 | 0.9 | 59 | 26 |
| 2019/1/10 | 100 | 良 | 75 | 113 | 14 | 1.5 | 79 | 17 |
| 2019/1/11 | 135 | 轻度污染 | 103 | 130 | 15 | 1.7 | 80 | 21 |
| 2019/1/12 | 267 | 重度污染 | 217 | 212 | 14 | 2.7 | 101 | 14 |
| 2019/1/13 | 169 | 中度污染 | 128 | 183 | 6 | 1.7 | 64 | 58 |
| 2019/1/14 | 137 | 轻度污染 | 104 | 143 | 8 | 1.7 | 72 | 46 |
| 2019/1/15 | 54 | 良 | 9 | 57 | 4 | 0.3 | 18 | 81 |
数据集中的一行通常称为一个样本观测。如表1中第二行是2019年1月1日的北京市空气质量数据,就是一个样本观测。若数据集由N个样本观测组成,则称该数据集的样本容量或样本量为N。机器学习在解决复杂问题时一般要求样本量较大的数据集。
数据集中的一列通常称为一个变量,用于描述数据的某种属性或状态。如表1.1中包括了空气质量监测的日期、空气质量指数 AQI、空气质量等级、PM2.5、PM10、SO₂、CO、NO₂、O3的浓度共9个变量。其中,AQI作为空气质量状况的无量纲指数,值越大表明空气中污染物浓度越高,空气质量越差。参与AQI评价的主要污染物包括PM2.5、PM10、SO₂、CO、NO₂、O₃这6项。空气质量等级是AQI的分组结果。一般AQI在0~50、51~100、101~150、151~200、201~300、大于300时,空气质量等级依次为优、良、轻度污染、中度污染、重度污染、严重污染。
依各变量的取值类型可将变量细分为数值型、顺序型和类别型三类,后两类统称为分类型。数值型变量是连续或非连续的数值(计算机中以整型或浮点型等存储类型存储),可以进行算术运算,如这里的AQI、PM2.5、PM10、SO₂、CO、NO₂、O₃等。分类型变量一般以数字或字符(A、B、C等)标签表示,算术运算对其没有意义。顺序型变量的标签存在高低、大小、强弱等顺序关系,如空气质量等级。此外,诸如学历、年龄段等变量也属顺序型。类别型变量的标签没有顺序关系,如日期。此外,诸如性别、籍贯等变量也属类别型。
机器学习以变量为基本数据建模单元,旨在发现变量取值之间的数量关系。不同机器学习算法适用于不同类型的变量,因此,明确变量类型是极为重要的。
表1所示数据是一种结构化数据的具体体现。结构化数据是计算机关系数据库的专业术语,还包括实体和属性等概念。其中实体对应这里的样本观测,属性对应这里的变量。结构化数据通常具有以下两个方面的特征:第一,变量值通常是可定长的。例如可定长的数值型,或可定长的数字或字符标签;第二,各实体都具有共同的、确定性的属性。例如,每天的空气质量实体都通过AQI、PM2.5等共同的属性度量。当然,不同日期AQI、PM2.5的具体值不尽相同。因此,采用二维表形式组织数据不仅直观且存储效率高。
机器学习的数据对象并不局限于结构化数据,还可以包括半结构化数据和非结构化数据。半结构化数据的重要特点是:包含可定长的属性和部分非定长的属性,且无法确保每个实体都具有共同的、确定性的属性。例如,员工简历数据就是一个典型的半结构化数据。其中,定长属性包括性别、年龄、学历等。非定长属性,如工作履历等。此外,未婚员工的配偶信息空缺,已婚员工的子女信息可能多样化等,不同的实体并非均具有共同的属性。对此,需经过一定的格式转换方可组织成二维表的形式,且表格中会存在一些数据冗余,使存储效率不高。半结构化数据往往可采用JSON文档格式组织。非结构化数据一般不方便直接采用二维表格形式组织。常见的非结构化数据主要有文本、图像、音频和视频数据等。这些数据往往是非定长的,且很难直接确定属性,需进行必要的数字化处理和格式转换。
2.2 机器学习的任务:数据建模
机器学习的核心任务是通过数据建模发现数据规律,主要分为 “数据预测”“数据聚类” 两大类,同时还包括关联分析、模式诊断等延伸应用。
2.2.1 数据预测
数据预测是基于已有数据集,提炼 “输入变量-输出变量”的数量关系——一方面识别对输出变量有显著影响的输入变量,另一方面利用该关系预测新数据的输出结果。根据输出变量类型,数据预测可分为“回归预测”(输出连续值)与“分类预测”(输出离散类别)。
(1)以空气质量监测数据集为例:
回归预测场景:探究SO₂、CO、NO₂、O₃对PM2.5浓度的影响——PM2.5为数值型输出变量,其他污染物为输入变量,通过建模可量化“SO₂浓度每增加1μg/m³,PM2.5浓度增加多少”,并基于其他污染物浓度预测PM2.5值;
分类预测场景:基于污染物浓度预测空气质量等级——空气质量等级为分类型输出变量,可通过建模判断 “当 PM2.5>115μg/m³且PM10>150μg/m³时,空气质量等级是否为中度污染”。
(2)再如顾客消费行为数据集(包含性别、年龄、职业、消费金额等特征):
分类预测:基于顾客特征预测 “是否购买某商品”(输出“是/否”二分类);
回归预测:基于顾客特征与消费行为预测“平均年收入”(输出连续数值)。
2.2.2 数据聚类
数据聚类的目标是在无标签数据中自主发现“子类(簇)”——即通过算法将特征相似的样本归为同一簇,使簇内样本相似度高、簇间样本相似度低。例如在顾客消费数据中,可通过聚类将“年轻高收入、频繁购买奢侈品”的顾客归为一类,“中年中等收入、偏好日用品”的顾客归为另一类,为精细化营销提供依据。
数据聚类与分类预测的核心区别在于:分类预测有明确的“输入-输出”标签,模型学习的是“已知类别”的映射关系;而聚类无标签,所有变量均参与分析,簇的含义需结合业务场景解读。
2.2.3 其他延伸应用
关联分析:挖掘变量取值间的关联规律。例如超市购物小票数据中,分析购买面包的顾客同时购买牛奶的概率和购买电水壶的顾客1个月内购买除垢剂的概率,为货架布置、营销推荐提供支撑;
模式诊断:识别数据中“局部、非随机、非常规”的特殊结构。例如工业生产中,设备电压、温度等数据的突发性剧烈波动,可能是间歇性故障的信号;金融场景中,信用卡刷卡金额的非常规激增,可能是恶意欺诈行为。这些模式与随机离群点不同,具有潜在成因与业务意义,是分析的核心目标。
更多推荐
所有评论(0)