
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
1、数据质量要求算法机器学习类别缺失值连续值不平衡数据离群点数据归一离散特征处理树形特征选择依据spark实现过拟合处理、参数xgboost二分类、多分类、回归不敏感不敏感不敏感敏感不敏感one-hot树或者线性模型目标函数增益第三方梯度提升决策树(GBDT)spark支持二分类、回归敏感,..

场景:大数据项目数据规模大,验证代码不可能拿实际项目数据跑,因此为了验证代码功能正确性,就可以利用造数或简单案例数据编写验证代码即单元测试。1、导入包import org.junit.Test2、@Test3、assert语句assert(condition) orassert(condition,StringMessage)4、示例代码class InvalidHandlerTest exten
1、file--new project 进入如下页面点击next,2、进入如下页面Name:填入项目名称Location:对应项目文件地址GroupId、ArtifactId,随意,会在pom文件中见到Version:默认,会在pom文件中见到点击 finish,3、进入如下页面,需要配置pom文件,添加依赖4、pom文件增加代码<inceptionYear>2008</ince
部分内容记录1.2数学符号1、一个样本是一个句子,一个句子里含有若干个词语2、根据一个词典,假设词典中有10,000个词,则可以将样本句子中的每个词根据在词典中的位置表示为one-hot编码向量,每个词都是10,000维...
这种问法是初接触者的困惑,尤其是现在铺天盖地的python机器学习课程,会让人以为python就是工作中主流了,那spark是干什么呢,Scala这个名字好像也听过。以下摘自一段相对好理解的回答:spark是用在大数据场景中的,python机器学习侧重数据分析场景,一般都是在本地机器上运行,常用的python库有sklearn,以及深度学习库tf, keras等。使用python的场合多是初学者入
部分内容记录:序号内容点1.4为什么深度学习会兴起?1、data_scale 与performance的二维图形,对于ml 当数据规模达到一定量后,算法性能表现不再上升,比较平稳;2、但是nn可以有更大的性能表现,随着训练一个更大规模的NN3、“scale drives deep learning progress":这里的scale 包含两部分:数据规模、网络规模4、在算法性能上升区域,是很难说
部分内容记录1.2数学符号1、一个样本是一个句子,一个句子里含有若干个词语2、根据一个词典,假设词典中有10,000个词,则可以将样本句子中的每个词根据在词典中的位置表示为one-hot编码向量,每个词都是10,000维...
最近有时间,想把李沐的《动手学深度学习》代码码一遍,这本书用的是tengsorflow2的版本,所以我也对应装一下。








