logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

spark读取PMML文件

使用python训练模型生成PMML文件,然后用spark读取package com.ubiai.zhyx.sparkimport com.ubiai.zhyx.utils.SparkHelperimport org.apache.spark.ml.Transformerimport org.apache.spark.sql.{DataFrame, SparkSession}import org.

#scala#spark#机器学习
大数据之HDFS的读写操作

大数据之HDFS的读写操作读操作官方图详解图流程解释1.客户端通过调用FileSystem对象的open()方法来打开希望读取的文件,对于HDFS来说,这个对象是DistributedFileSystem,它通过使用远程过程调用(RPC)来调用namenode,以确定文件起始块的位置2.对于每一个块,NameNode返回存有该块副本的DataNode地址,并根据距离客户端的远近来排序。3.Dist

#hdfs
大数据之hive概述

hive简介Hive最早来源于FaceBook ,因为FaceBook网站每天产生海量的结构化日志数据,为了对这些数据进行管理,并且因为机器学习的需求,产生了Hive这门技术,并继续发展成为一个成功的Apache项目。hive的架构图示用户连接接口CLI:是指Shell命令行 JDBC/ODBC:是指Hive的JAVA实现,与传统数据库JDBC类似。 WebUI:是指可通过浏览器访问Hive。th

#hive#hadoop#大数据 +1
DataX遇到的坑

今天在使用DataX的时候遇到一个小坑在调度任务的时候出现以下错误File "datax.py", line 114print readerRef^SyntaxError: Missing parentheses in call to 'print'. Did you mean print(readerRef)?是因为python的环境不匹配,修改python环境为2.7.5即可运行按照以下步骤r

#linux#centos
到底了