
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文介绍了新手爬取豆瓣电影Top250数据的实践过程。通过分析网页结构,定位电影信息的XPath路径,使用requests和lxml库实现爬取功能。程序处理了特殊字符、导演信息分割、年份提取等细节,最终将250部电影数据保存为Excel文件,包含标题、评分、导演、年份等9个字段。
决策树是一种应用广泛的归纳推理算法。在分类问题中,基于特征对样本进行分类,构成一棵包含一系列if-then规则的树,在数学上可以看成特征空间与类空间的条件概率分布。
支持向量机(SVM)是一种基于间隔最大化的二分类模型,可分为线性可分、线性不可分和非线性三种类型。线性可分SVM通过寻找最优超平面实现分类,采用拉格朗日对偶法求解;线性不可分SVM引入松弛变量实现软间隔最大化;非线性SVM通过核技巧将数据映射到高维空间转化为线性问题。SMO算法通过每次优化两个拉格朗日乘子来高效求解SVM问题。SVM具有分类效果好、泛化能力强等特点,适用于各种分类任务。
开学第七周,开启机器学习新篇章。机器学习是人工智能的核心分支,本质是通过让计算机通过数据学习规律实现自主决策、预测或模式识别。核心逻辑就是给它一串数据,通过特定的模型训练让它找到数据的内在规律对我们想要解决的问题进行一个预测。在寻找适合的模型中,我们要采取各种算法提高其准确度。下面是关于我在搜集资料后拟写的一个思维导图回归的本质是拟合一条“ 曲线 / 平面 ”,并尽可能让所有的数据都在这条线上,也
本文总结了Python requests库的安装与使用。以百度翻译为例,展示了获取URL、User-Agent、参数后发送请求并保存JSON格式结果的完整爬取流程。







