logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大数据开发升级之路 | WordCount入门程序详解

driver类负责配置job并提交,比如指定Mapper/Reducer,设置kv类型,输入输出的地址等,同时程序也从这里进入。WordCountMapper.java(Mapper映射)Mapper映射类负责将读取的数据映射为<k, v>的键值对形式,WordCountMapper代码为逐行读取文本,将一行内容拆分成若干<字母, 1> 对。WordCountReducer.java(Reduce

文章图片
#大数据#java
大数据开发升级之路 | HDFS理论详解

随着数据量越来越大,在一个操作系统存不下所有的数据,那么就分配到更多的操作系统管理的磁盘中,但是不方便管理和维护,迫切需要一种系统来管理多台机器上的文件,这就是分布式文件管理系统,HDFS就是分布式文件管理系统中的一种。HDFS适合一次写入,多次读出的场景(Why?-> HDFS不支持并发写入和随机写入-> 强制一次性写入使得系统无需关注数据一致性,并且实现了简单的元数据管理和高吞吐数据写入HDF

文章图片
#大数据#hdfs#hadoop
大数据升级之路 | 流计算案例(电商销售额实时监控系统)

摘要:该项目构建了一个基于流计算的电商实时销售额监控系统,采用Kafka+Storm+Redis+SpringBoot技术栈。系统通过Kafka接收模拟订单数据,由Storm实时计算销售总额和商品维度数据,结果存入Redis并通过SpringBoot接口可视化展示。相比传统批处理方案,实现了秒级延迟的实时数据分析,解决了数据滞后、手工汇总效率低等问题。项目代码已开源(https://github.

文章图片
#大数据#java#redis +3
大数据升级之路 | MapReduce原理详解

在处理 TB 、PB 级的数据时,单机计算能力不足决定了数据必须要在分布式集群上面处理,那么久必然要在分布式集群上进行分布式计算,但如若没有一个统一的框架开发者必定要自己处理任务拆分,负载均衡,节点宕机后的处理与恢复等问题,非常麻烦,所以出现了MapReduce,它将复杂的分布式计算封装到了框架之中,让开发人员可以不必关注底层逻辑,将精力集中在业务逻辑的开发上。易于编程,良好扩展性,高容错性(某一

文章图片
#大数据#mapreduce#hadoop
大数据升级之路 | Storm理论详解

随着越来越多的场景对Hadoop的MapReduce高延迟无法容忍,比如网站统计、推荐系统、预警系统、金融系统(高频交易、股票)等等,大数据实时处理解决方案(流计算)的应用日趋广泛,目前已是分布式技术领域最新爆发点,而Storm更是流计算技术中的佼佼者和主流。

文章图片
#大数据#storm
‘AI’第二课堂笔记(pandas)

‘AI’第二课堂笔记(pandas)主要目的是通过真实的数据,以实战的方式了解数据分析的流程和熟悉数据分析python的基本操作。知道了课程的目的之后,我们接下来我们要正式的开始数据分析的实战教学,完成kaggle上泰坦尼克的任务,实战数据分析全流程。

文章图片
#python#pandas
到底了