logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

数据挖掘(pandas&xgboost)

类别特征处理1、利用pd.get_dummies方法将类别特征进行编码。使用get_dummies进行one-hot编码(查看时间字段的类型,如果不是datetime类型需要to_datetime转化)例如:下面代码实现对age字段的转化,其中convert_age为转化函数,将对应的age、sex、user_lv进行one-hot编码,并concat一起,dump保存。user['age'].m

#数据挖掘#pandas
数据挖掘学习(二)

1、train.csv这里采用的数据集来自于Kaggle | Allstate Claims Severity比赛,这里的训练集如下所示,有116个离散特征(cat1-cat116),14个连续特征(cont1 -cont14)2、xgboost代码分析import numpy as npimport pandas as pdimport xgboost as xgbimpor

#数据挖掘
数据挖掘(pandas&xgboost)

类别特征处理1、利用pd.get_dummies方法将类别特征进行编码。使用get_dummies进行one-hot编码(查看时间字段的类型,如果不是datetime类型需要to_datetime转化)例如:下面代码实现对age字段的转化,其中convert_age为转化函数,将对应的age、sex、user_lv进行one-hot编码,并concat一起,dump保存。user['age'].m

#数据挖掘#pandas
hadoop学习笔记(一)

Hadoop之FileSystem文件的操作//读数据Hadoop中的IOUtils类的两个静态方法:1)IOUtils.copyBytes(),其中in表示拷贝源,System.out表示拷贝目的地(也就是要拷贝到标准输出中去),4096表示用来拷贝的buffer大小,false表明拷贝完成后我们并不关闭拷贝源可拷贝目的地(因为System.out并不需要关闭,in可以在finally语

#hadoop
Spark学习笔记(六)

Json-SparkSQLJSON的流行特点:简单,重点内容紧凑,易于阅读灵活的模式每个JSON对象都是自描述的Web服务之间的的数据交换格式例如:Facebook和Twitter API高度用于移动和Web应用程序开发大量的JSON数据集JSON的灵活性使得生成JSON数据集变得容易,But,JSON的灵活性使得难以分析JSON数据集。Difference:- 定义模

#spark#json
到底了