大数据平台技术选型
一、先定架构:4种主流(必选一种)
1. 湖仓一体 Lakehouse(企业首选,最推荐)
- 优点:统一存储、批流一体、ACID、成本低、支持结构化+非结构化
- 场景:PB级数据、实时数仓、统一数据平台、多业务线
- 技术栈:Kafka + Flink + Spark + Iceberg/Hudi + Doris/StarRocks
- 结论:90%中大厂直接选这套
2. Lambda 架构(老系统兼容)
- 批流两套引擎,离线Hive/Spark + 实时Flink
- 缺点:维护两套、口径难统一
- 结论:不推荐新系统用
3. Kappa 架构(极简实时)
- 全部走流:Kafka + Flink 搞定批+流
- 场景:实时为主、日志、监控、大屏
- 结论:实时业务优先
4. 传统数仓(Hive)
- 只做T+1离线报表
- 结论:只适合传统小厂、不做主推
二、核心组件选型(直接给结论)
1)消息队列(必选)
- Kafka(唯一选择)
- 高吞吐、持久化、流计算标准入口
- 场景:日志、CDC、实时入湖、流缓冲
2)数据同步(采集)
- 业务库 CDC:Canal / Debezium
- 全量同步:DataX
- 实时入湖:Flink CDC(企业主流)
3)计算引擎(最关键)
离线计算
- Spark(ETL、机器学习、批量计算)
实时计算(流批一体)
- Flink(实时数仓、实时报表、实时大屏、CEP)
结论:Spark 离线 + Flink 实时 = 企业标准组合
4)存储层(湖仓一体核心)
分布式文件存储
- HDFS / 云OSS(数据湖底座)
湖仓表格式(三选一)
- Iceberg(通用、兼容好、推荐)
- Hudi(Upsert强、实时入湖首选)
- Paimon(阿里新版、流批一体更强)
5)OLAP 查询引擎(最重要、决定快不快)
企业必选:Apache Doris(综合最强)
- 兼容MySQL、高并发、多表join强、易运维、实时写入
- 场景:报表、多维分析、用户画像、订单分析、BI
单表极速:ClickHouse
- 单表查询最快、并发一般
- 场景:日志分析、时序、埋点
存算分离、云原生:StarRocks
- 场景:弹性扩缩、云上部署
结论:90%企业直接选 Doris 不会错
6)任务调度
- DolphinScheduler(开源最强、国产、易用)
- 企业级:Airflow(复杂)、XXL-Job(轻量)
7)数据质量
- Great Expectations
- 阿里/华为内部:DataWorks、DataArts
8)BI 可视化
- Superset(开源免费)
- FineBI(国产企业级、权限强)
三、企业级标准技术栈(直接抄)
方案A:湖仓一体(最通用、90%企业)
- 存储:HDFS/OSS
- 调度:DolphinScheduler
- 采集:Flink CDC + Canal
- 计算:Spark + Flink
- 查询:Doris
- 湖格式:Iceberg
方案B:极简实时平台(实时大屏、监控)
方案C:原有Hadoop升级(平滑迁移)
四、按场景直接给答案(拿来就用)
1)企业要统一大数据平台、实时+离线
👉 湖仓一体:Kafka + Flink + Spark + Iceberg + Doris
2)只要快、报表多、并发高
👉 Doris
3)日志、时序、单表超大、不怎么join
👉 ClickHouse
4)存量Hive太慢、不想迁移
👉 Hive 存冷 + Doris 查热
5)云原生、弹性扩缩
👉 StarRocks + OSS + 托管Flink
6)小公司、简单报表、不想运维
👉 Doris 单机/简单集群 + DataX + DolphinScheduler
五、选型金标准(面试/架构必背)
1. 架构首选湖仓一体
2. 计算必选 Spark + Flink
3. OLAP 首选 Doris
4. 实时入湖用 Flink CDC
5. 湖格式用 Iceberg
6. 调度用 DolphinScheduler
7. 消息队列只用 Kafka
六、一句话总结(面试直接说)
大数据平台选型以湖仓一体为核心架构,采用 Kafka + Flink + Spark + Iceberg + Doris 技术栈,实现批流一体、统一存储、高并发低延迟查询,满足企业离线ETL、实时数仓、BI报表、多维分析全场景需求。
更多推荐

所有评论(0)