阿里云ACP大数据备考攻略第三弹
·
621-1000 一刷
一.全面知识框架:阿里云大数据产品矩阵

| 对比维度 | MaxCompute (ODPS) | AnalyticDB for MySQL (ADS) | Tablestore (OTS) | RDS / DRDS | OSS |
|---|---|---|---|---|---|
| 产品类型 | 离线数仓 / 批处理引擎 | 实时 OLAP / MPP 数据库 | NoSQL 宽表数据库 | 关系型数据库 (OLTP) | 对象存储服务 |
| 核心场景 | T+1 报表、ETL、大规模机器学习、历史数据分析 | 交互式 BI、即席查询、实时大屏、多维分析 | 高并发在线业务、消息/Feed流、用户画像、元数据存储 | 在线交易系统、Web应用后端、核心业务库 | 存储图片、视频、日志、备份等非结构化数据 |
| 数据时效性 | 离线 (T+1 或更长) | 实时/准实时 (秒级) | 实时 (毫秒级) | 实时 (毫秒级) | 实时 |
| 数据模型 | 结构化(表)、半结构化(JSON) | 结构化(表) | 宽表模型(主键 + 属性列) | 结构化(表、行、列) | 非结构化(Key-Value,Object) |
| 事务 (ACID) | ❌ 不支持 | ✅ 支持 | ⚠️ 单行原子;同分区键下多行事务 | ✅ 完整 ACID | ❌ 不支持 |
| 索引 | ❌ 不支持 | ✅ 智能自动索引、聚集列 | ✅ 主键索引、全局二级索引 (GSI) | ✅ B-Tree 索引 | ❌ 无传统索引(可通过文件名前缀模拟) |
| JOIN 能力 | ✅ 强大(MapJoin, SkewJoin) | ✅ 强大(Shuffle-Free Join) | ❌ 不支持 SQL JOIN | ✅ 标准 SQL JOIN | ❌ 不支持 |
| SQL 支持 | MaxCompute SQL(类 HiveQL) | 标准 MySQL 协议 | SDK / RESTful API(非 SQL) | 标准 SQL | ❌ 不支持 SQL(需配合其他计算引擎) |
| 一致性模型 | 最终一致性(批量写入) | 强一致性 | 全局强一致性 | 强一致性 | 最终一致性 |
| 典型访问方式 | DataWorks, odpscmd, SDK, Tunnel | JDBC/ODBC, MySQL Client | SDK (Java/Python等), RESTful API | JDBC/ODBC, MySQL Client | SDK, HTTP/HTTPS, FTP |
| 存储成本 | 低(压缩列存) | 中高(为性能和实时性牺牲成本) | 中(按读写吞吐和存储量计费) | 中 | 极低(海量存储的首选) |
| 【ACP 常考点】 | - 不支持事务、索引 - 生命周期管理 - DataWorks 调度机制 | - 实时 vs 离线 - 特色功能:多值列、空间列 - DUMP DATA ... LIMIT N 行数 ≤ N | - 全局强一致性 - 单行写原子 - 吞吐量单位 (4KB) | - RDS 天生具备:主备、自动备份 - RDS 不自动修复安全漏洞 | - 成本最低的存储方案 - 适合静态资源 |
二.常考易错知识点
1.MaxCompute/ODPS+Elasticsearch+Hologres
1.1 大数据计算服务(MaxCompute, 原ODPS)中调用MapReduce时,需要使用jar命令来调用
1.2 ODPSSQL 目前最多支持128个并发insert overwrite/ into 操作
1.3 Maxcompute中,当一个用户被移除后,与该用户有关的ACL/Policy/Label授权会保留
1.4 MaxCompute分区表的分区字段的值默认不允许为NULL,有的话语句无法正常执行,系统会抛异常
1.5 一次性工作流无法修改成周期性工作流,手动任务和周期任务是分离的。手动任务也可以运行多天的数据,可以根据需要进行补数据或其他操作。周期任务和一次性工作流在运维中属于两个模块,无法共同开发共同调度。
1.6 在进⾏INSERT更新表数据时,源表与⽬标表的对应关系依赖于在select⼦句中列的顺序,而不是 表与表之间列名的对应关系。select * 的顺序和目标表字段顺序不一致,会造成内容会次序颠倒。
1.7 可以将源数据表中某一列作为切分键,建议使用主键或有索引的列作为切分键,仅支持类型为整型的字段。 读取数据时,根据配置的字段进行数据分片,实现并发读取,可以提升数据同步效率。 分片是为了提高数据抽取速率,一般选用主键或索引,底层会切分成相同等分,不会出现数据热点问题。
1.8 ODPS中提供了别名命令ALIAS<alias><real>,可以为资源设置别名
1.9 Flink全托管:基于K8s容器部署。 Flink半托管/EMR:即阿里云E-MapReduce上的Dataflow集群。 Flink全托管:如果公司或团队希望专注于业务开发,不希望花费太多精力在集群运维上,推荐您使用Flink全托管产品。 Flink全托管支持Per-Job集群和Session集群两种集群模式。
1.10 迁移助手支持迁移周期任务、手动任务、资源、函数、数据源、表元数据、临时查询和组件等对象。您可以根据业务需求,选择全量导出、增量导出或自选导出等方式导出DataWorks中的开发成果。
1.10 Hologres创建点查场景的表时,需要注意如下几点: Key/Value点查的Key字段需要设置为主键(Primary Key)。 Primary Key与Clustering Key保持一致。 需要将查询条件中的列设置为Distribution Key,一般默认主键为Distribution Key。 表的存储类型需要设置为行存。 建议连接Hologres实例时使用VPC网络的域名。 当有TEXT、VARCHAR、CHAR类型时,建议使用TEXT类型,而不是VARCHAR或者CHAR类型。
1.11 Flink SQL支持的窗口聚合主要是两种:Window聚合和Over聚合。
1.12 Hologres支持行存、列存、行列共存等多种存储模式和索引类型,同时满足简单查询、复杂查询、即席查询等多样化的分析查询需求。
1.13 mapjoin最多支持指定128张小表,否则报语法错误。 不支持full outer join。 在mapjoin中,可以使用不等值连接或or连接多个条件。 MaxCompute的JOIN支持多路连接,但不支持CROSS JOIN操作,即无ON条件的连接。
1.14 在DataWorks数据访问页面的访问行为包括(Select、Create、Insert)操作,但不包括访问失败的行为
1.15 DataWorks数据保护伞模块提供了数据脱敏管理,包含静态脱敏合动态脱敏2类。以下属于动态脱敏的是(展示脱敏、数据分析脱敏、底层脱敏等脱敏场景)
1.16 下列Hologres的扩展函数中,属于流量分析函数的是(漏斗分析函数、 明细圈人函数、 Roaring Bitmap函数)
1.17 MaxCompute SQL中的分区操作Partition添加分区:MaxCompute单表支持的分区数量上限为6万个。对于有多级分区的表,如果需要添加新的分区值,必须指明全部的分区。 修改分区值:不支持修改分区列的列名,只能修改分区列对应的值。对于有多级分区的表,必须指明全部的分区。
1.18 Flink全托管支持以下三种资源配置模式: 基础模式、 专家模式 (BETA)、 智能模式(BETA)
1.19 DataWorks数据分析中,关于维表创建,添加表的字段,仅支持STRING类型
1.20 MaxCompute逻辑层是核心部分,实现用户空间和对象的管理、命令的解析与执行逻辑、数据对象的访问控制与授权等功能。
1.21 可以在完成敏感数据规则配置的第二天, 进入导出行为页签,查看问人员从MaxCompute中导出数据至外部的情况。包括查询时间段内的数据导出的总量、每天导出的数据量和数据导出总量的前五名
1.22 分库分表合并同步:支持使用正则表达式定义库名和表名,匹配数据源的多张分库分表,合并后同步到下游的一张表中。 对于分库分表合并同步的场景,您可以结合MySQL Catalog,利用正则表达式的表名和库名来匹配所要同步的多张表。使用CTAS可以将这多张分库分表合并到一张Hologres表中,库名和表名会作为额外的两个字段写入到该表中,为保证主键唯一性,库名、表名和原主键一起作为该Hologres表的新联合主键。 如果在user02新增一列age,并插入一条数据。此时虽然多张分表的Schema并不一致,但是user02上后续的数据和Schema变更都能实时地自动同步到下游表中。
| 步骤 | 技术/功能 | 详细说明 | 【ACP 常考点】 |
|---|---|---|---|
| a. 源表发现 | 正则表达式匹配 | - 通过 库名正则 (如 user_db_\d+) 和 表名正则 (如 user_info_\d+)- 自动发现并匹配所有符合条件的分库分表。 | 支持正则表达式是实现自动化同步的前提。 |
| b. 元数据整合 | MySQL Catalog | - 利用 MySQL 的元数据信息(Catalog),动态获取每个匹配到的表的 Schema(字段名、类型)。 - 无需手动为每张分表配置映射关系。 | Catalog 是实现 Schema 自动感知和异构表同步的关键。 |
| c. 数据写入 | CTAS (Create Table As Select) | - 使用 CTAS 语句,将上游所有匹配表的数据 一次性合并写入 到一张新的 Hologres 表中。 - 自动创建下游表的结构。 - 不支持作业调试。 - 执行前必须已在工作空间注册目标端 Catalog。 - 支持通过 STATEMENT SET 将多个 CTAS 打包提交,复用 Source 节点,降低源库压力。 - 能实时同步上游 Schema 变更到下游表。 | CTAS 是高效建表、初始加载和实现 Schema Evolution 的标准方式。 【高频多选题】:STATEMENT SET 优化、Schema 自动同步是核心优势。 |
| d. 元数据注入 | 注入库名/表名字段 | - 系统会自动将源表的 库名 和 表名 作为两个额外的字段(例如 _db_name_, _table_name_)写入到下游 Hologres 表中。 | 这是保证数据可追溯性和解决多源冲突的关键设计。 |
| e. 主键设计 | 联合主键 | - 为了保证合并后数据的全局唯一性,新表的主键由三部分组成:原主键 + _db_name_ + _table_name_。 | 【必考】:必须能准确说出联合主键的构成及其必要性。 |
1.23 在Hologress中对目标表操作时,使用TTL(time_to_live_in_seconds数据生命周期管理)来指定表数据的生存时间,单位为秒。TTL过期时间是以(数据第一次写入的时间)为准
1.24 在Hologress性能调优时,(Analyze)命令用于收集数据库中表内容的统计信息,优化器会根据这些统计信息生成最佳的查询计划,从而提高查询效率。
1.25 Apache Spark Streaming是Spark核心API的一个扩展,可以实现高吞吐量的、具有容错机制的实时流数据处理。与Flink相比独有的特性是(使用 micro-batching方式进行数据处理、无缝内嵌其他spark模块)
1.26 Hologres 兼容PostgreSQL协议和语法,支持大部分PostgreSQL函数,但 并未说明兼容MySQL全部函数
1.27 通过REST API查询Elasticsearch文档时,通过(query_string)语法将用户输入关键词发送给Elasticsearch。
1.28 阿里云实时计算常用的作业调优的类型(参数调优、自动资源调优、手动资源调优)
1.29 阿里云流计算对外接口包括(StreamSQL、UDF)
1.30 在Hologres实时数仓场景应当遵循一定场景选择原则,选择最合适的场景,如果有实时需求,但是实时性要求不是很高,但开发效率优先,适合(分钟级查询)
1.31 在进行资源配置时,建议Source节点并发度和分区数乘比例配置,例如Kafka有16个分区,则并发度建议设置为16、8或4,这样做的原因是(避免数据倾斜)
1.32 MaxCompute是适用于数据分析场景的企业级SaaS(Software as a Service)模式云数据仓库,以Serverless架构提供快速、全托管的在线数据仓库服务,消除了传统数据平台在资源扩展性和弹性方面的限制,最小化用户运维投入,使您可以经济并高效地分析处理海量数据。
1.33 阿里云 Hologres是一站式实时数据仓库引擎,支持海量数据实时写入、实时更新、实时分析,支持标准SQL(兼容PostgreSQL协议),支持PB级数据多维分析(OLAP)与即席分析(Ad Hoc),支持高并发低延迟的在线数据服务(Serving),与MaxCompute、Flink、DataWorks深度融合,提供离在线一体化全栈数仓解决方案。
1.34 SQE(Seahaws Query Engine) 无缝对接MaxCompute(ODPS)的执行引擎,实现对MaxCompute的本地访问,无需迁移和导入数据,就可以高性能和全兼容的访问各种MaxCompute文件格式,以及Hash/Range clustered table等复杂表,实现对PB级离线数据的交互式分析
1.35 对于阿里云实时计算上下游存储,一般广泛采用(Kafka)作为流式数据的数据源表和结果表
1.36 在DataWorks中,属于数据安全管理的脱敏规则的是(掩盖、置空、字符替换、HASH加密、取整、保留格式)
1.37 针对传统的SQL执行要经过优化器、协调器、查询引擎、存储引擎等多个组件的效率低下的问题,Hologres使用了(Fixed Plan)来提升SQL执行效率,是支持该吞吐实时写入,高并发查询的关键方法。
1.38 在执行引擎中(PQE (Postgres Query Engine))用于兼容Postgres提供扩展能力,支持PG生态的各种扩展组件,如PostGIS,UDF(PL/JAVA,PL/SQL,PL/Python)等。
1.39 在DataWorks配置脱敏规则,数据分级规则要求分级名称必须唯一,分级数字越大,数据敏感程度越高,最多支持(10)级。
1.40 在任务运行的过程中,我们需要查看作业性能,然后通过配置参数来进行调优,(IO吞吐)不是阿里云实时计算支持的性能参数的查看
1.41 阿里云实时计算定义为一种轻量级计算引擎,本身不带有任何业务数据存储系统。阿里云实时计算均是使用外部数据存储作为数据来源和数据目的端进行使用。 阿里云实时计算引用外部数据存储的方式有两种:明文方式、Catalog
1.42 MacComputeSQL和标准SQL的区别包括(不支持如事务、主键约束、索引)
1.43 撤回机制Retraction实阿里云实时计算Flink非常重要的一个机制,Retraction 是否生效取决于 算子是否产生更新流 (如 GROUP BY 聚合、DISTINCT 等),而非“层数”。即使只有一层聚合操作,也会触发 Retraction 机制。
1.44 通过 RESTAPI写入 Elasticsearch文档,PUT请求指定索引名称、类型、主键,内容为JSON 格式文档
1.45 阿里云实时计算本身不带有数据存储功能,所有涉及表创建DDL的操作,实际上均是对于外部数据表、存储的引用声明
1.46 物化视图(Materialized View)本质是一种预计算,即把某些耗时的操作(例如JOIN、AGGREGATE)的结果保存下来,以便在查询时直接复用,从而避免这些耗时的操作,最终达到加速查询的目的。 视图是一种虚拟表,任何对视图的查询,都会转换为视图SQL语句的查询。而物化视图是一种特殊的物理表,物化视图会存储实际的数据,占用存储资源。 物化视图最重要的作用就是对查询语句进行查询改写,如果期望查询语句能利用物化视图进行查询改写,则需要在查询语句前添加set odps.sql.materialized.view.enable.auto.rewriting=true;配置。当物化视图处于失效状态时不支持查询改写,查询语句会直接查询源表而无法获得加速作用。
1.47 Tunnel当前不支持外部表操作。 Tunnel当前仅支持表 (不包括视图View) 数据的上传下载。 Tunnel命令不支持上传下载ARRAY、MAP和STRUCT类型的数据。 每个Tunnel的Session在服务端的生命周期为24小时。 如果用户根据Session下载,请注意只有主账号创建的Session,可以被主账号及所属子账号下载。
1.48 实时计算SQL是阿里云实时计算为简化计算模型、降低用户使用实时计算门槛而设计的一套符合标准 SQL语义的开发语言。下面符合阿里云实时计算DDL的语法有( 操作语句(INSERT INTO)、QUERY语句( SELECT FROM))
1.49 阿里云数据湖构建(Data Lake Formation,简称 DLF)是一款全托管的快速帮助用户构建云上数据湖及Lakehouse的服务,(text)是其元数据抽取不支持的格式
1.50 DataWorks数据分析中,关于数据服务的应用场景是(场景一,数据供应给内部应用。 场景二:数据共享给合作伙伴使用。 场景三:数据销售变现)
1.51 Elasticsearch是基于Lucene的底层查询并作优化,其内核查询性能优化主要有(内核查询->按列查询、 wisp协程技术、 预读)
1.52 通过REST API查询Elasticsearch文档时,通过(agg)语法可以对数据聚合统计
1.53 数据湖权限支持配置元数据库、元数据表、元数据列、元数据函数四种纬度的权限,配置权限时需要包含如下三个要素:主体Principal、资源(Resource)、访问资源的方式(Access)
1.54 Elasticsearch写入优化中,每个shard的indexing buffer相关参数有(indices.memory.max_index_buffer_size默认无限制、 indices.memory.index_buffer_size 默认是整个堆空间的10%、 indices.memory.min_index_buffer_size默认48MB)
1.55 Elasticsearch集群监控,既可以通过传统的DSL来完成查看,也可以通过GUI页面来直观分析。
1.56 Apache Flink具有3层组件栈架构,(Runtime层)实现了Apache Flink核心计算能力
1.57 在Hologres中对目标表操作时,字典编码对于字符串类型可以有效压缩,特别是基数小的列,编码值将字符串比较转为(数字)比较,可以加速group by 查询
1.58 使用Elasticsearch DSL修改数据语法可以对数据进行更新,PUT请求插入新文档覆盖相同主键的旧文档、POST请求更新文档字段值,
1.59 在 Hologres 中,对于行存表,默认主键为clustering key。 必须为not nullable的列或者列组合,不支持Float、Double、Array、Json及其他复杂数据类型。 查询具备左匹配原则。
1.60 阿里MaxCompute属于(Saas)云产品
1.61 Elasticsearch写入优化中,(index.translog.durability : async)可以设置translog策略为异步
1.62 DataHub是(流式数据)的处理平台,提供对流式数据的发布 (Publish)、订阅 (Subscribe)和分发功能,支持流式数据归档
1.63 使用Elasticsearch产品前,需要创建相关实例,Elasticsearch实例创建过程中,配置登录名称及密码应在(网络和系统配置)界面进行
1.64 在大数据开发治理平台DataWorks中,业务流程中的节点上下游依赖关系,要根据节点的(节点输出名)来设置
1.65 在阿里云实时计算运维作业调优过程中,PartialFinal(解决COUNT DISTINCT热点问题)。 MiniBatch:提升吞吐,降低对下游压力仅对Group by有效。 LocalGlobal:优化数据倾斜问题。 添加或删除MiniBatch或LocalGlobal参数,job状态会丢失,修改值大小状态不会丢失。
1.66 在阿里云实时计算Flink中,本身不带有任何业务数据存储系统,所以在实时计算的过程中,均是使用外部数据存储作为数据来源和结果输出。明文方式是通过在作业的DDL语句WITH参数中配置accessId和accessKey,来引用上下游存储资源。明文方式不仅支持同账号(包括其RAM用户)授权,同时还支持跨账号授权。
1.67 在使用Elasticsearch进行数据查询时,有时候我们希望检索能够快速实现,不太在精确的的命中数据,通常会使用(terminate_after)字段来提前结束搜索
1.68 Elasticsearch数据存储概念中,映射(mapping): mapping用来定义一个文档以及其所包含的字段如何被存储和索引,相当于关系型数据库中的Schema,例如在mapping中定义字段的名称和类型,以及所使用的分词器。 字段(field): field是组成文档的最小单位,相当于关系型数据库中的一列数据。 文档(document): 一个文档是可以被索引的基本信息单元,相当于关系型数据库中的一行数据。例如,您可以为一个客户创建一个文档,或者为一个商品创建一个文档。文档可以用JSON格式来表示。在一个索引中,您可以存储任意多的文档,且文档必须被索引。 类型(type): 一个类型通常是一个索引的一个逻辑分类或分区,允许在一个索引下存储不同类型的文档,相当于关系型数据库中的一张表,例如用户类型、博客类型等。
1.69 在Kibana堆栈监测查看Elasticsearch集群节点信息,API正确的描述是(GET /_cat/nodes?v)
GET /_cat/nodes?v:查看集群中各个节点的当前状态。包括节点CPU使用率、HeapMemory使用率、负载情况等。 GET /_cat/thread_pool?v:查看各节点的线程池统计信息。包括线程池的类型、活跃线程数、任务队列大小等。 GET /_cat/health?v:查看集群的健康状态。 GET /_cat/indices?v:查看集群中所有索引的详细信息。
1.70 Maxcompute作业执行时,长尾问题产生的核心原因是(Task的大部分instances 都己经执行完成,少数instance运行时间过长)
1.71 在DataWorks配置脱敏规则,置空要求将表中需要脱敏的字段,直接设置为(空字符串)
1.72 数据质量使用内置模版规则进行规则定义时,(OSS)不符合数据源监控规则
1.73 在 kibana 开发工具中分析当前执行任务,查看任务类型、持续时间。(POST_tasks/_cancel?nodes=nodeld1, nodeld2)可以实现按节点杀任务
1.74 (HQE (Hologres Query Engine))是Hologres自研执行引擎,采用可扩展的MPP架构全并行计算,向量化算子发挥CPU极致算力,从而实现极致的查询性能。
1.75 对于行存储和列存储的区别由(将Flush写到文件)过程决定的
1.76 注册Calalog后,无需通过DDL语句手动注册对应的数据源表,可以提开开发效率和正确性。可以使用DDL命令注册Catalog。
2.AnalyticDB/ADS
2.1 关于ADS中的ECU,ECU的数量,在DB创建后可以修改。即使在DB的使用过程中,也可以随时调整(扩容或者缩容)
2.2 ADS中不支持表连接方式(right、笛卡尔积、full)
2.3 分析型数据库MySQL版不支持自定义精度
2.4 DMS(原Idb Cloud)是一款访问管理云端数据的 WEB 服务,覆盖 RDS,ADS 等阿里云环境,DMS 具有功能(对象管理、实例管理、数据管理)
3.Tablestore/OTS
4.RDS/DRDS
4.1 在RDS连接闪断发生的场景中,有可能是由于实例本身故障引起的是(主库出现故障)
4.2 由于RDS只读实例的数据均由源数据库实例同步而来,只读实例可以使用(独立的白名单配置)
4.3 对于MySQL类型实例,最多可创建500个数据库
4.4 RDS多可用区实现了ECS和RDS间的网络延迟更小
4.5 DRDS的服务可用性不低于99.95%
4.6 当从云数据库RDS MySQL版抽取数据时,为提高数据同步的效率可以设置成多并发,需要配置(不要设置作业速率上限+切分键)实现。
4.7 RDS提供的系统性能监控项目有(IOPS、网络流量、TPS、CPU利用率)
4.8 RDS的实例空间主要包括了:数据文件,日志文件,其他文件(包括系统文件,临时文件)
5.OSS
5.1 在数据湖的游戏行业应用场景中,采用OSS替代HDFS,作为企业统一数据湖,采用分层存储的好处是降低用户使用成本 。
5.2 对象存储OSS提供标准、低频访问、归档、冷归档、深度冷归档五种存储类型,全面覆盖从热到冷的各种数据存储场景。
5.3 阿里云对象存储 OSS(Object Storage Service)是阿里云提高的海量、安全、低成本、高可靠的云存储服务,现某医院需保存病人的病例及化验、影响等数据。使用OSS里(归档)存储类型最划算
5.4 关于OSS存储类型的适用场景,低频访问(Infrequent Access):适用于较低访问频率(平均每月访问频率1到2次)的业务场景。 标准存储(Standard):适用于各种社交、分享类的图片、音视频应用、大型网站、大数据分析等业务场景。 归档存储适用于数据长期保存的业务场景。 冷归档存储适用于需要超长时间存放的冷数据。 深度冷归档存储(Deep Cold Archive)适用于需要超长时间存放的极冷数据。
5.5 阿里云OSS-HDFS服务(JindoFS服务)是OSS新推出的存储空间类型,兼容HDFS接口,支持目录以及目录层级。即插即用。OSS和OSS-HDFS是云原生存储服务,通过Restful API提供服务,本身无需部署。在阿里云EMR集群中,已默认安装 JindoSDK,可以通过JindoSDK直接访问
5.6 如果数据被转为归档、冷归档的数据将无法被计算引擎所访问,您必须手工对其进行解冻恢复才可继续使用,且解冻有相关费用产生。
6.机器学习
6.1 机器学习中的每个数据都是样本,使用的数据作为数据集。数据集常用划分方法(留出法、交叉验证法、自助法)
6.2 在PAI Designer开发场景中,(T检验)不是厲于数据预处理的过程
6.3 特征工程是描述样本特性的维度,传统机器学习和深度学习针对特征的可解释性都强
7.运维
7.1 Logstash支持所有主流日志类型。 Kibana是灵活的数据分析和可视化工具,支持多用户登录。 Beats是轻量级的数据采集工具,集合了多种单一用途的数据采集器。 开源Elasticsearch是一个基于Lucene的实时分布式的搜索与分析引擎
7.2 某用户担心突发大流量DDOS攻击超过DDOS基础防护的上限影响网站访问,可以选择开通(DDOS高防IP),用较低的成本扩大N倍的防护能力
7.3 Elasticseach集群监控界面,集群状态有三种状态,分别用3种颜色表示,RED:不是所有的主要分片都可用。 YELLOW:所有主分片可用,但不是所有副本分片都可用。 green:所有主要分片和副本分片都可用。
7.4 Lakehouse采用的是(Kappa)架构
7.5 某公司运维审计人员想要看下工作空间的风险处理结果和风险分布情况,如查看昨天、近一周和近一月的风险概述、风险量趋势和风险事件维度分析,可以从(数据审计)页面展示
7.6 Lambda架构:一种逻辑两套代码,开发运维难、实时和批量结果不一致引起的冲突、服务器存储开销大。 Kappa架构:服务器成本浪费。
7.7 EMR 集群节点类型主要分以下四种: 1.Master 节点:Master 部署Master服务, HDFS Name Node 和 YARN ResourceManager。 HA 机制。 2.Core 节点:Core 节点主要部署 YARN NodeManager 和 DataNode。不支持弹性伸缩。 3.Task 节点:TASK部署 YARN NodeMananger,但不会部署DataNode,支持竞价实例和弹性伸缩,支持GPU实例和异构计算 4.Gateway 节点:Gateway集群,部署了Hadoop、Spark、Flink的客户端文件,支持部署不同部门采用不同的参数和配置
7.8 在DataWorks配置脱敏规则,配置的数据分级规则不能被删除可能的原因是(分级下有敏感字段类型)
7.9 绑定Hologres实例按钮为灰色 问题现象:绑定Hologres实例时,绑定HologresDB按钮为灰色。 可能原因: 当前账号不是所登录DataWorks项目空间的管理员。 当前DataWorks绑定的计算引擎实例数量已达当前版本的上限。
7.10 GET /_cat/thread_pool?v: 查看各节点的线程池统计信息。包括线程池的类型、活跃线程数、任务队列大小等
8.数据分析
8.1 维度建模法典型代表就是星型模型、雪花模型
8.2 列存:适用于OLAP场景,适合各种复杂查询、数据关联、扫描、过滤和统计。 行存:适合基于Primary Key点查的场景, 行列共存:支持行存和列存的所有场景,以及非主键点查的场景
8.3 SQL优化可以发现并解决数据膨胀、热数据、数据倾斜的问题,但无法解决资源不足的问题。资源不足通常需要通过增加硬件资源或优化系统架构来解决。
8.4 元数据备份不属于元数据管理的功能。
8.5 COPY TO语句将SELECT查询的结果内容复制到一个文件或者其他输出介质中。COPY FROM语句用于从一个文件复制数据到一个表。hg_dump_to_oss命令:用于将在Hologres中查询的结果dump到指定的OSS。
8.6 DataWorks的数据分析模块核心功能(SQL查询、电子表格、维表)
8.7 阿里云数据湖构建(Data Lake Formation,简称 DLF)是一款全托管的快速帮助用户构建云上数据湖及Lakehouse的服务,在入湖任务管理时,不支持(本地自建MySQL 数据全量入湖)入湖任务
8.8 数据质量进行模版配置规则选择不同的校验类型,对应不同的校验方式,如果选择的校验类型为数值型,目前校验仅支持与(固定值)比较。
8.9 数据湖是为企业的业务诉求服务的,是为发现数据价值提供的一套数据解决方案,具备(数据存储、数据分析、数据管理)能力,才能满足业务需求
8.10 Hologres支持实时存储,可以进行数据的交互式分析
8.11 数据治理的需求可以分抽象为五个层次,(时效)是最基础的要求
8.12 新一代技术理念HSAP(Hybrid Serving/Analytics Processing)分析、服务一体化,统一数据服务层,旨在通过一套系统支持高QPS在线服务场景和实施OLAP多维分析,(分布式)符合一站式大数据HSAP系统的主要特点。
8.13 实时数据分析指的是根据业务目标,从原始数据中抽取对应信息并整合的过程。例如,查看每天销量前10的商品、仓库平均周转时间、文档平均单击率和推送打开率等。实时数据分析则是上述过程的实时化,通常在终端体现为实时报表或实时大屏
8.14 数据搬迁。集群资源不足时,新增节点需要进行数据搬迁,将原节点上的部分数据搬到新节点,达到集群的shard均衡;集群资源过剩时,减少节点,需要将下线节点的数据搬到其他节点。两种行为都需要大量数据搬迁。
更多推荐
所有评论(0)