logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

pyspark 提交yarn-cluster模式总结

pyspark 提交yarn-cluster模式总结用conda创建虚拟python环境,在虚拟环境中安装依赖包(pyspark包不需要),配置好的环境会保存在…/anaconda/envs/ 目录下,然后利用zip打包上传到hdfs上(e.g. hdfs://HDFS80043/spark-python/pyspark_3.7.zip)对于较大型的项目,需要多个py文件依赖的,将所有...

NLP之文本分类(二)---FastText

参考资料:https://blog.csdn.net/feilong_csdn/article/details/88655927https://fasttext.cc/docs/en/supervised-tutorial.htmlhttps://fasttext.cc1.背景:fasttext文本分类效率较高,可以快速生成文本分类baseline, 本文主要是了解fasttext核心优化点,以及

#自然语言处理#机器学习#深度学习
NLP之文本分类(四)---多标签分类初探

1. 多标签分类多标签学习[MLL]由一个样例和一个集合标签组成。任务分解: MLL包括主要任务: 多标签分类(MLC)和标签排序(LR)阈值校准: 设定排序的阈值任务 特点:(1)不同数据集多标签程度不同。衡量多标签程度自然方式: 即样本平均标签数。标签密度用标签集大小来规范化标签基数标签多样性: 数据集中不同标签集合的数量,可以用数据及大小规范化。(2)标签具有相互关系多标签数据集中学习的关键

#分类#自然语言处理#机器学习
机器学习----lightGBM安装

win7+python2.71. install from pip(1)首先需要安装 VC runtime(可编译C++的小程序):http://download.csdn.net/download/zhouwenyuan1015/9944566VC_redist.x64.exe(2)安装pip install lightgbmins

tensorflow --batch内负采样

class NegativeCosineLayer():""" 自定义batch内负采样并做cosine相似度的层 """"""负采样原理:query_input.shape = [batch_size, dim]doc_input.shape = [batch_size, dim]默认 query点击该doc。每个点击的item, 随机采集NEG个item负样本1. 假设每个正样本要采集N个负样

#tensorflow#batch#深度学习
推荐系统中评估指标

1. Recall :召回率(recall)=TP/(TP+FN) 【预测为真正/实际为正】通俗解释:正样本中有多少是被找了出来2. HR@K (hit_rate) : 命中率分母: 模型预测给出的topk推荐列表个数。分子: 模型预测的topk中有多少是实际点击的。通俗理解:模型给出topk结果,有多少是命中实际点击的。注意: 召回率与命中率是不一样的。...

#机器学习#深度学习#人工智能
python学习----pearsonr(x,y)相关系数计算

函数:pearsonr(x,y)功能:计算特征与目标变量之间的相关度参数说明:1)输入:x为特征,y为目标变量.2)输出:r: 相关系数 [-1,1]之间,p-value: p值。注: p值越小,表示相关系数越显著,一般p值在500个样本以上时有较高的可靠性。python实现import numpy as npfrom scipy.stats im

#python
    共 16 条
  • 1
  • 2
  • 请选择