
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
最底层:HDFS 存数据,YARN 分资源。中间层:MapReduce/Tez/Spark 做计算。业务层:Hive/Pig 做数据仓库分析,HBase 做实时查询。辅助层:Zookeeper 协调,Flume/Sqoop 负责数据采集,Ambari/Oozie 负责运维调度。plaintextWeb日志 → Flume采集 → HDFS存储 → MapReduce清洗 → Hive分析 → Sq
ZooKeeper 不是一个业务系统,而是分布式系统的基础设施。它的核心价值,就是把分布式系统中最复杂的「协调问题」标准化、组件化,让开发者不用再重复造轮子,专注于业务本身。
想象一下,当我们面对海量数据时,如何像指挥千军万马一样,轻松完成统计、分析任务?今天,我们就用一个校园小故事,揭开大数据工具的神秘面纱。
Flume 是大数据领域流式日志采集工具,可实现海量业务日志的自动化采集、传输与存储,被形象比作大数据里的 “智能快递员”。Source负责采集数据源、Channel作为缓冲区保障数据可靠、Sink将数据推送至 HDFS 等存储端。整体架构分工清晰,可稳定处理高并发日志数据,是大数据预处理阶段的常用工具。
想象一下,当我们面对海量数据时,如何像指挥千军万马一样,轻松完成统计、分析任务?今天,我们就用一个校园小故事,揭开大数据工具的神秘面纱。
Kickstart 本质上是一个「自动填写安装问卷」的脚本文件(通常叫ks.cfg它就像考试时,有个学霸提前帮你填好了所有选择题答案,安装程序全程不用问你任何问题,直接一路 “下一步” 完成系统部署。图2 Kickstart把等软件包放入指定目录,比如;运行createrepo命令生成仓库元数据;客户端只需要配置对应的.repo文件,就能直接用一键安装软件。
最底层:HDFS 存数据,YARN 分资源。中间层:MapReduce/Tez/Spark 做计算。业务层:Hive/Pig 做数据仓库分析,HBase 做实时查询。辅助层:Zookeeper 协调,Flume/Sqoop 负责数据采集,Ambari/Oozie 负责运维调度。plaintextWeb日志 → Flume采集 → HDFS存储 → MapReduce清洗 → Hive分析 → Sq







