
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
介绍在数据挖掘中,经常会存在不平衡数据的分类问题,比如在异常监控预测中,由于异常就大多数情况下都不会出现,因此想要达到良好的识别效果普通的分类算法还远远不够,这里介绍几种处理不平衡数据的常用方法及对比。符号表示记多数类的样本集合为L,少数类的样本集合为S。用r=|S|/|L|表示少数类与多数类的比例基准我们先用一个逻辑斯谛回归作为该实验的基准:Weighted loss fu...
Cube-Studio是由腾讯音乐开源的一款云原生一站式AI中台,覆盖机器学习/深度学习/LLM大模型,开发、训练、推理、应用,全链路。该项目目前已是国内最火的开源算法全链路中台,上千家企业私有化部署和项目交付,非常适合数据算法架构团队搭建公司级AI中台,以及toB企业算法中台类项目交付。

(作者:陈玓玏)一、 实现功能从CSV文件中读取数据,然后构建深度神经网络,各层神经元个数分别为3/5/2/4/1,因为是二分类问题,所以输出层只需要一个神经元。前四层,包括输入层的激活函数都是Relu,还定义了Elu函数,是Relu函数的改进版,输出层使用的是sigmoid激活函数。损失函数定义为交叉熵损失函数,优化方法采用的梯度下降法。最后对结果进行评估,虽然神经网络中通常是使用准确度来评..
(作者:陈玓玏)在使用tensorflow建立深度神经网络的过程中,在几次迭代之后发现所有的权重都变为了nan,导致整个网络都无法正常工作。出现这个问题我知道的可能有以下两个原因。1) 样本未进行归一化因为每次迭代都要计算σ(x∗ω+b)\sigma(x*\omega+b)σ(x∗ω+b),而深度神经网络的参数众多,如果样本不进行归一化,很容易出现x∗ω+bx*\omega+bx∗ω+b溢出...
配置和模板参考helm仓库:https://artifacthub.io/packages/helm/apache-hadoop-helm/hadoop。

(作者:陈玓玏 data-master)spark-sql任务跑着跑着,碰到一个bug:Containeron host:was preempted又是一个新鲜的bug呢!!一通查资料,得出一个初步结论:因为我的任务,其中有task占用的内存太大,而我们的yarn又是使用的公平调度机制,当有新任务来的时候,我的task对应的容器就会被别的任务抢占。于是就简单了解下yarn的公平调度机制。yarn有
K-S评估和AUC评估
(作者:陈玓玏)昨天在用用Pycharm读取一个200+M的CSV的过程中,竟然出现了Memory Error!简直让我怀疑自己买了个假电脑,毕竟是8G内存i7处理器,一度怀疑自己装了假的内存条。。。。下面说一下几个解题步骤。。。。一般就是用下面这些方法了,按顺序试试。一、逐行读取如果你用pd.read_csv来读文件,会一次性把数据都读到内存里来,导致内存爆掉,那么一个想法就是一...

(作者:陈玓玏)决策树的本质是什么?是将特征空间逐级划分,如下图过程所示:图示就是每次都找不同的切分点,将样本空间逐渐进行细分,最后把属于同一类的空间进行合并,就形成了决策边界,树的层次越深,决策边界的切分就越细,区分越准确,同时也越有可能产生过拟合。这也就是说,决策树最重要的一件事情就是:怎么找切分点?基本的决策树算法有三类,按时间顺序分别是:ID3、C4.5、CART。...
(作者:陈玓玏)在实际使用Python的过程中,我们常常需要安装不同版本的Python环境,并且安装相应的各个package。这里我们解决三个问题:anaconda中如何安装多个版本的Python;anaconda中如何安装不同版本的Python对应的各个package;如何改变镜像源加速下载。一. anaconda中如何安装多个版本的Python1)在开始菜单中找到anacon...







