logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Spark 机器学习库 MLlib 编程实践:PCA(主成分分析);利用 CrossValidator 确定最优的参数。

摘要:本文介绍了使用Spark MLlib进行机器学习编程实践的过程。实验从adult数据集导入开始,通过PCA对6个数值型特征降维至3维,然后构建包含标签索引化、特征处理、逻辑回归和标签转换的完整机器学习流水线。实验展示了如何训练分类模型预测居民收入是否超过50K,并提供了模型评估方法。实验环境为Win10系统下的VirtualBox虚拟机运行Linux系统。

#spark#机器学习#mllib
Python爬虫-豆瓣读书爬虫

本文介绍了一个豆瓣读书爬虫程序,能够爬取指定标签下的图书信息并按评分排序存储到Excel中。程序使用Python编写,采用requests和BeautifulSoup库实现网页抓取,通过UserAgent伪装和随机延时避免被反爬。主要功能包括:1)爬取图书名称、评分、评价人数、作者和出版社等信息;2)筛选评价人数>1000的高分书籍;3)按不同主题分类存储到Excel的不同Sheet中。程序

#python#爬虫#开发语言
到底了