
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
Spark 机器学习库 MLlib 编程实践:PCA(主成分分析);利用 CrossValidator 确定最优的参数。
摘要:本文介绍了使用Spark MLlib进行机器学习编程实践的过程。实验从adult数据集导入开始,通过PCA对6个数值型特征降维至3维,然后构建包含标签索引化、特征处理、逻辑回归和标签转换的完整机器学习流水线。实验展示了如何训练分类模型预测居民收入是否超过50K,并提供了模型评估方法。实验环境为Win10系统下的VirtualBox虚拟机运行Linux系统。
Python爬虫-豆瓣读书爬虫
本文介绍了一个豆瓣读书爬虫程序,能够爬取指定标签下的图书信息并按评分排序存储到Excel中。程序使用Python编写,采用requests和BeautifulSoup库实现网页抓取,通过UserAgent伪装和随机延时避免被反爬。主要功能包括:1)爬取图书名称、评分、评价人数、作者和出版社等信息;2)筛选评价人数>1000的高分书籍;3)按不同主题分类存储到Excel的不同Sheet中。程序
到底了







