
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文简要介绍了机器学习中的集成学习概念。集成学习是通过结合多个学习器(模型)来完成学习任务的方法,包含两个关键步骤:选择多个学习器和确定结合策略。其优势在于能提高模型准确率,通过少数服从多数等策略使误差相互抵消。集成学习可分为同质/异质集成(按学习器关系)和串行/并行集成(按学习顺序)。同质集成使用相同类型的学习器,而异质集成组合不同类型;并行集成中各学习器独立运行,串行集成则存在依赖关系。后续文

本文介绍了线性模型中的线性回归和逻辑回归两种基础算法。首先通过西瓜分类的例子解释了建模的本质是构建函数,并强调了参数训练的重要性。接着讲解了模型评估方法,重点介绍了均方误差(MSE)等回归评估指标。在详细阐述线性回归时,说明了其几何意义是通过数据点拟合最佳直线,并重点讲解了梯度下降法的求解步骤。文章还扩展了多元线性回归的矩阵表示和非线性回归的广义线性函数概念。最后指出尽管深度学习盛行,但简单模型仍

本文介绍了聚类算法的基础知识,重点阐述了聚类性能度量的两类指标。外部指标通过比较聚类结果与其他算法结果,使用JC系数、FM指数和RI指数进行评估;内部指标则直接评估聚类结果,关注簇内距离(avg,diam)和簇间距离(dmin,dcen),形成DB指数和Dunn指数。文章通过服装店用户分类的实例,说明聚类在无标签数据中的应用,并详细解释了各指标的计算方法和评价标准。

本文介绍了机器学习中的分类问题,重点讲解了二分类和多分类的解决方法。对于二分类问题,通过引入sigmoid函数(特别是对数几率函数)将线性回归的输出映射到[0,1]区间,解决了单位阶跃函数不连续的问题,并提供了概率化输出。对于多分类问题,介绍了三种拆分策略:一对一、一对多和多对多,分析了各自的优缺点。特别详细说明了多对多策略中的纠错编码(ECOC)方法,通过编码解码过程实现分类,并解释了其纠错原理

本文主要探讨线性模型中的两类关键问题:类别不平衡问题和降维处理。针对类别不平衡问题,介绍了三种解决方法:欠采样(如EasyEnsemble算法)、过采样(如SMOTE算法)和阈值移动。在降维处理方面,重点讲解了线性判别分析(LDA/Fisher判别分析)的原理和实现步骤,包括计算类内散度矩阵、类间散度矩阵,通过最大化广义瑞利商找到最佳投影方向。这些方法能有效解决实际应用中常见的类别分布不均和维度灾

摘要:本文介绍了一个基于BP神经网络的校园快递驿站排队时间预测系统开发项目。项目通过收集时段、课程安排、天气等6个关键指标数据,使用双隐含层BP神经网络进行建模,最终实现0.9的可决系数和2分钟内的预测误差。系统部署采用微信小程序形式,通过API接口连接预测模型。作者分享了从数据收集、模型训练到小程序开发的全过程经验,并指出AI生成数据存在规律性问题,建议实际应用时采用真实数据。该项目为校园快递服

本文记录了作者参与AI数字人情感陪护系统开发比赛的技术探索过程。文章详细梳理了项目需求和技术路线,包括语音识别、情绪识别、大模型回复、语音合成和数字人驱动等模块的实现尝试。作者通过小demo试验逐步理解项目核心,发现最初定位与主办方提供的数据存在偏差,转而聚焦多模态情感识别和数字人面部驱动。文中分享了环境配置、模型部署中的各种报错及解决方案,包括网络访问、磁盘空间、版本兼容等问题,体现了技术实践中

本文记录了作者参与AI数字人情感陪护系统开发比赛的技术探索过程。文章详细梳理了项目需求和技术路线,包括语音识别、情绪识别、大模型回复、语音合成和数字人驱动等模块的实现尝试。作者通过小demo试验逐步理解项目核心,发现最初定位与主办方提供的数据存在偏差,转而聚焦多模态情感识别和数字人面部驱动。文中分享了环境配置、模型部署中的各种报错及解决方案,包括网络访问、磁盘空间、版本兼容等问题,体现了技术实践中

本文介绍了Pandas库中常用的统计函数及其使用方法。主要内容包括:1) DataFrame的轴概念,axis=0表示垂直轴,axis=1表示水平轴;2) 统计函数的基本用法,如mean()、max()、min()、sum()、count()和median();3) 单列统计和多列统计的区别,多列统计返回Series对象;4) round()函数的三种用法,用于数据取整处理。文章通过具体示例说明了

摘要:本文介绍了一个基于BP神经网络的校园快递驿站排队时间预测系统开发项目。项目通过收集时段、课程安排、天气等6个关键指标数据,使用双隐含层BP神经网络进行建模,最终实现0.9的可决系数和2分钟内的预测误差。系统部署采用微信小程序形式,通过API接口连接预测模型。作者分享了从数据收集、模型训练到小程序开发的全过程经验,并指出AI生成数据存在规律性问题,建议实际应用时采用真实数据。该项目为校园快递服








