01导论——《大数据平台架构(主编:吕欣 黄宏斌)》读书笔记1
·
大数据平台解剖课——从“杂货堆”到“智能工厂”的蜕变
问题:数据像杂货堆一样混乱,如何变成流水线上的“标准化零件”?
企业数据来源五花八门:ERP系统里的表格、生产线上的传感器信号、客服录音、甚至竞品的网页截图。这些数据格式不一、质量参差,就像一堆螺丝钉、齿轮和塑料片混在一起。核心矛盾是:如何把“杂货堆”变成能组装出“智能机器”的标准化零件?
架构六层法:数据流水线的秘密
- 数据源层:原料入库。
- 结构化数据:MySQL里的订单表(规整如乐高积木);
- 非结构化数据:CT影像(像未切割的玉石,需要额外加工)。
- 数据采集与传输层(Flume/Kafka):物流车队。
Kafka像“数据快递员”,实时把社交媒体评论流、工厂设备状态流分拣到不同仓库,且不堵车(高吞吐)。 - 数据存储层(HDFS/HBase/MySQL、Oracle):智能仓库。
- HDFS存原始数据(如视频文件),冷数据自动归档到廉价硬盘;
- HBase存需要实时查询的数据(如用户最新位置),像超市货架随取随用。
- MySQL、Oracle存关系型数据
- 数据计算与查询层(Spark/Flink/MapReduce/Hive/YARN):加工车间。
- Spark是“批量加工线”,适合T+1的报表生成;
- Flink是“实时流水线”,比如抖音实时推荐“可能感兴趣的人”。
- MapReduce负责批处理
- Hive是数据仓库
- YARN负责资源管理
- 数据分析与应用层(TensorFlow/Tableau):产品组装。
- 机器学习模型像“智能质检员”,从数据中找出次品模式(如金融反欺诈);
- Tableau把数据变成可视化报表,让老板一眼看懂“哪里亏钱了”。
- 平台管理层(ZooKeeper):车间调度。
确保CPU和内存资源不被“饿死”或“撑死”,像美团骑手调度系统,让集群效率最大化。
实战案例:医疗大数据平台如何救命?
北京安定医院的精神疾病平台用Hadoop整合了病历、影像和基因数据:
- 数据清洗:剔除“年龄200岁”的脏数据;
- 特征工程:把“患者主诉”文本转化为“焦虑指数”;
- 模型训练:用历史数据训练复发预测模型,准确率79.1%;
- 临床应用:医生输入新患者数据,系统提示“高复发风险”,提前干预。
痛点在于数据孤岛——不同医院的病历格式不统一,像iPhone和安卓充电线互不兼容。
未来展望:从“人适应数据”到“数据适应人”
- 自动化数据治理:AI自动识别数据schema(如发现“血压字段”单位有的是mmHg,有的是kPa),并提示人工校准。
- 低代码平台:让业务人员用拖拽方式生成数据分析流程,就像用Excel做图表一样简单。
- 量子计算突围:面对ZB级数据,传统分布式计算已到瓶颈。量子并行计算可能在未来十年颠覆游戏规则——比如秒级破解现在需要一年的基因组分析任务。
更多推荐
所有评论(0)