
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
这几年来,机器学习和数据挖掘非常火热,它们逐渐为世界带来实际价值。与此同时,越来越多的机器学习算法从学术界走向工业界,而在这个过程中会有很多困难。数据不平衡问题虽然不是最难的,但绝对是最重要的问题之一。一、数据不平衡在学术研究与教学中,很多算法都有一个基本假设,那就是数据分布是均匀的。当我们把这些算法直接应用于实际数据时,大多数情况下都无法取得理想的结果。因为实际数据往往分布得很不
课程链接:http://www.powercam.cc/slide/6552。Kernel Methord 的基本思想: Kernal的基本思想是,将低维空间不可分数据映射到高纬度的空间,比如说左图的数据是线性不可分的,分界线是:,将数据映射到三维空间,就可以得到线性的分类面,总结:在低维空间线性不可分,映射
没有高质量的数据,就没有高质量的数据挖掘结果,数据值缺失是数据分析中经常遇到的问题之一。当缺失比例很小时,可直接对缺失记录进行舍弃或进行手工处理。但在实际数据中,往往缺失数据占有相当的比重。这时如果手工处理非常低效,如果舍弃缺失记录,则会丢失大量信息,使不完全观测数据与完全观测数据间产生系统差异,对这样的数据进行分析,你很可能会得出错误的结论。造成数据缺失的原因现实世界中的
转载自 哈工大SCIR热身:一个基于矩阵的快速计算神经网络输出的方法
说明:我是在keras的官方demo上进行修改https://github.com/fchollet/keras/blob/master/examples/imdb_cnn.py1、几点说明,从文件中读入数据,会降低GPU的使用率,如果能够直接将数据载入内存,GPU的使用率会比较高。下面进行对比:全部数据载入内存,GPU的使用率:使用队列,边读数据边进行训练:结论:
转载自 哈工大SCIR热身:一个基于矩阵的快速计算神经网络输出的方法
import tensorflow as tfimport sysfrom tensorflow.examples.tutorials.mnist import input_data# this is datamnist = input_data.read_data_sets('MNIST_data', one_hot=True)# hyperparameterslr = 0.00
处理离散型特征和连续型特征并存的情况,如何做归一化。参考博客进行了总结:https://www.quora.com/What-are-good-ways-to-handle-discrete-and-continuous-inputs-together总结如下:1、拿到获取的原始特征,必须对每一特征分别进行归一化,比如,特征A的取值范围是[-1000,1000],特征B的取值范围是
SVM模型有两个非常重要的参数C与gamma。其中 C是惩罚系数,即对误差的宽容度。c越高,说明越不能容忍出现误差,容易过拟合。C越小,容易欠拟合。C过大或过小,泛化能力变差 gamma是选择RBF函数作为kernel后,该函数自带的一个参数。隐含地决定了数据映射到新的特征空间后的分布,gamma越大,支持向量越少,gamma值越小,支持向量越多。支持向量的个数影响训练
安装sklearn之前,我们需要先安装numpy,scipy函数库。 说说我的经历,我是从网上下的numpy-MKL-1.8.0.win-amd64-py2.7.exe,scipy_0.14.0.win_amd64_py2.7.exe,scikit-learn-0.14.1.win-amd64-py2.7.exe,完全装好之后,但是运行不了。 当要运行如下语







