logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

使用python实现MapReduce的wordcount实例

Hadopp的基本框架是用java实现的,而各类书籍基本也是以java为例实现mapreduce,但笔者日常工作都是用python,故此找了一些资料来用python实现mapreduce实例。一、环境1、Hadoop-2.7.3完全分布式搭建()2、python3.5二、基本思想介绍使用python实现mapreduce调用的是Hadoop Stream,主要利用STDIN(标

#mapreduce#python#hadoop
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

引言Google在2018年发出来的论文,原文地址:BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

知识图谱:行业图谱实战

一、前言关于知识图谱的概念,这里不加赘述,可以参考:知识图谱简介下文会基于上市公司的基本数据,如:行业、地区、高管等,进行一个简单的实战。二、构建步骤1、数据抽取上市公司的信息可以从很多地方获取到,包括证监会或各类财经网站,或者工商局官网等等,基于获取难度与项目要求,使用以下网站:新浪财经巨潮资讯网(1)上市公司基本数据这里从新浪财经获取,基本没有难度,笔者已经...

#知识图谱
python爬虫爬取拉勾网职业信息

一、前言最近想做一份关于拉勾网数据分析类职业的报告,便顺手写了个简单的爬虫,记录分享如下。二、思路整理1、首先我们打开拉勾网,并搜索“”数据分析“”,显示出来的职位便是我们的目标2、接下来我们需要确定,怎样将信息提取出来(1)查看页面源代码,这时候发现,页面源码里面找不到职位相关信息,这证明拉勾网关于职位的信息是异步加载的,这也是一种很常用的技术(2)异步加载的信息,我们需

#爬虫#python#数据分析
词向量:基于Skip-Gram的Word2Vec神经网络实现

一、前言1、理解Word2Vec之Skip-Gram模型二、实战1、数据源:cvpr2016_flowers,国内下载比较麻烦,数据量也不多,建议用其它数据2、数据处理class Text:def __init__(self):self.data_name = 'text_c10'self.file_list = self._ge

#神经网络#python#word2vec
csr_matrix和csc_matrix简析

一、概念csr_matrix(Compressed Sparse Row matrix)或csc_matric(Compressed Sparse Column marix),为压缩稀疏矩阵的存储方式。这里均以scipy包中的方法作为例子,具体可看:文档二、简析1、scipy.sparse.csr_matrix>>> indptr = np.array([

依存分析:中文依存句法分析简介

一、句法分析句法分析是自然语言处理中的关键技术之一,其基本任务是确定句子的句法结构或者句子中词汇之间的依存关系。主要包括两方面的内容,一是确定语言的语法体系,即对语言中合法的句子的语法结构给与形式化的定义;另一方面是句法分析技术,即根据给定的语法体系,自动推导出句子的句法结构,分析句子所包含的句法单位和这些句法单位之间的关系。二、语法体系句法分析需要遵循某一语法体系,根据该体系

神经网络简单介绍

一、神经网络是什么?目前最广泛使用的定义是Kohonen于1988年的描述,神经网络是由具有适应性的简单单元组成的广泛并行互连的网络,它的组织能够模拟生物神经系统对真实世界物体所做出的交互反应。二、神经网络的组成1、神经元模型神经元模型,即上述定义中的简单单元。在生物神经网络中,每个神经元与其他神经元相连,当它兴奋时,就会向相连的神经元发送化学物质,从而改变这些神经元内的电位;

#神经网络
到底了