阿里云ACP大数据备考攻略第六弹
·
1.MaxCompute
1.1 Maxcompute中,当一个用户被移除后,与该用户有关的(ACL/policy)授权会保留
1.2 大数据计算服务(MaxCompute, 原ODPS)中调用MapReduce时,需要使用(jar)命令来调用
1.3 ODPS授权:ACL授权不能一次操作一组对象,只能将一个对象的多个权限—次性授予一个用户
1.4 MaxCompute支持上传的单个资源大小上限为500 MB,资源包括以下几种类型: File类型、Table类型、JAR类型、Archive类型、Python类型
1.5 想统计 prj1 每天执行时间最长且任务负责人为自己的10个任务,通过(运维中心的任务运维列表)可以快速查到
1.6 ODPS中提供了别名命令ALIAS<alias><real>,可以为(资源)对象设置别名
1.7 添加分区时,ODPS支持的分区数量上限是4万,对于多级分区的表,如果想添加新的分区,必须指明全部的分区值--说法错误,因为ODPS分区上限是6万
1.8 关于ODPS Policy授权,支持sql、json,不支持xml
1.9 表是MaxCompute的数据存储单元。MaxCompute中不同类型作业的操作对象(输入、输出)都是表。表通常是一种(结构化)数据格式。
1.10 MaxCompute SQL 1.0版包括的数据类型有Biglnt, Float, String, Date Time, Boolean。--说法错误,没有float,有double
1.11 在MaxCompute中,DataHub是实时数据(Streaming Data)的处理平台-说法错误,DataHub是流式数据处理平台
1.12 在MaxCompute中,向某个分区插入数据时,分区列不允许出现在select子句中。如下语句会返回报错,sale_date和region为分区列,不允许出现在静态分区的select子句中
1.13 云原生开源大数据平台E-MapReduce,是运行在阿里云平台上的一种大数据处理的系统解决方案,支持分钟级创建集群和弹性伸缩。其弹性伸缩支持(集群规模、集群负载、时间)模式
1.14 ODPSSQL 目前最多支持(128)个并发insert overwrite/ into 操作
1.15 在MacCompute项目中,可以通过Tunnel下载表和实例。但由于下载操作存在数据泄露安全风险,需要对该操作权限进行限制。MacCompute支持通过Download权限控制方案,对(用户)和(角色)进行管控,提升项目数据安全性,避免出现数据泄露情况。
1.16 使用DataX将存储在对象存储OSS中的数据同步至阿里云端大数据计算服务(MaxCompute,原ODPS)时,以(OSS 的object)为粒度进行切分实现并发处理
2.DataWorks
2.1 在大数据开发治理平台DataWorks中,配置切分键不会出现数据热点
2.2 DataWorks迁移助手支持(增量、全量、自选)方式可以导出任务
2.3 在DataWorks数据访问页面的访问行为包括(select、create、insert)操作,但不包括访问失败的行为--不包含delete
2.4 DataWorks数据保护伞模块提供了数据脱敏管理,包含静态脱敏合动态脱敏2类。属于动态脱敏的是(数据分析脱敏、展示脱敏、底层脱敏)--不包含数据集成脱敏
2.5 在DataWorks中,属于数据安全管理的脱敏规则的是(掩盖、置空、字符替换、HASH加密、取整、保留格式)--隐藏不算
2.6 DataWorks的数据分析模块有(SQL查询、电子表格、维表)核心功能--一键生成API接口不算
2.7 DataWorks 中,数据科学不是功能模块
2.8 DataWorks的数据地图功能可以实现对数据的统一管理和对血缘的追踪,不包含加载入库和数据处理
2.9 在数据地图中,不能修改表结构、更新数据
2.10 数据集成是DataWorks的核心能力之一,提供了面向业务场景的同步任务配置化方案,支持不同数据源的一键同步功能
2.11 在大数据开发治理平台DataWorks中,将运行失败的节点从业务流程中删除 是错误的操作
2.12 在DataWorks数据审计页面,对风险事件维度分析可以根据(类型、标签、分级)三个维度,展示各类风险数的占比
3.ADS
3.1 关于ADS中的ECU,ECU的数量,在DB创建后可以修改。即使在DB的使用过程中,也可以随时调整(扩容或者缩容)
4.RDS/DRDS
4.1 RDS关系型数据库服务支持(SQLServer、MYSQL)数据库
5.通用
5.1 数据质量按模版匹配规则使用时,支持(波动率型、数值型)校验类型
5.2 10亿条数据查询秒级获取是Quick BI 的产品优势,千亿级数据秒级处理的说法是错误的
5.3 OLAP数据分析中,核心组件包括ClickHouse、Doris、Tensorfilow、Pytorch错误, TensorFlow、PyTorch 属于机器学习框架,不属于 EMR OLAP 场景的核心组件
5.4 关于阿里云数据湖元数据,(元数据备份)不是元数据管理的功能
5.5 DMS 具有(对象管理、实例管理、数据管理)功能--但不具备数据库创建能力
5.6 COPY命令是PostgreSQL 表和标准文件系统之间移动数据的工具,COPY TO语句将SELECT查询的结果内容复制到一个文件或者其他输出介质中。COPY FROM语句用于从一个文件复制数据到一个表。hg_dump_to_oss命令:用于将在Hologres中查询的结果dump到指定的OSS。
5.7 数据湖方案 采用OSS替代HDFS,作为企业统一数据湖,采用分层存储降低用户使用成本
5.8 机器学习中的每个数据都是样本,使用的数据作为数据集。(随机法)不是数据集常用划分方法。
5.9 阿里云数据湖构建(Data Lake Formation,简称 DLF)是一款全托管的快速帮助用户构建云上数据湖及Lakehouse的服务,(text)是其元数据抽取不支持的格式
5.10 需要Join 的表,尽量放在同一个Table Group--表述错误,是必须放同一个
5.11 阿里云数据湖构建(Data Lake Formation,简称 DLF)其进行数据权限管理时,支持配置元数据库、元数据表、元数据列、元数据函数四种维度的权限,包含的权限要素是(主体、资源、访问方式)--不包含实例
5.12 阿里云数据湖构建(Data Lake Formation,DLF)是一款全托管的快速构建云上数据湖及Lakehouse的服务,其数据权限管理时,库支持CreateTable、List等权限,表支持Select、Update等权限,列只支持Select权限。
5.13 (数据ETL操作)不是数据集成的使用场景
5.14 在经典大数据平台架构中,服务层为应用层提供接口和服务,(数据ETL)不属于服务层
5.15 直接挂载存储不是常用的分布式架构
5.16 Delta、 Hudi、CSV、Parquet、JSON、ORC等数据格式,这些格式中,属于行列混合式存储的数据格式是(json)
5.17 数据质量配置可通过(试跑日志),确认此次任务产出的数据是否符合预期及验证表规则的适用性
5.18 工作空间是PAI的顶层概念,为企业和团队提供统一的计算资源管理及人员权限管理能力,为AI开发者提供支持团队协作的全流程开发工具及AI资产管理能力。(任务管理、数据集管理、镜像管理)属于AI资产管理
5.19 当我们需要关联某张表在指定时间范围内的数据时,会使用Interval Join查询数据,使用Interval Join而不使用Regular Join查询的原因是(减少查询数据量,提升查询性能)
5.20 创建表时,可以通过选择合适的分布列的原则不包括(选择Where条件列为分布列)
5.21 传统机器学习的特征(特征易于理解、根据业务人员选择)
5.22 Lakehouse方案简化了整个数据链路,并提高了数据链路的定时性,它从原来的 Lambda升级为Kappa架构,相对于Lambda架构,Kappa架构的优点包括(可扩展的Schema管理,对元数据的处理速度快、结构简单,运维难度小)
5.23 数据安全平台的安全中心提供的数据访问控制功能,方便用户以可视化的方式(申请、审批、审计)相关权限,查看审批流程并跟进审批进度,进行权限的管控。
5.24 数据质量支持和(调度任务)关联,在表规则与其绑定后,任务实例运行完成都会触发数据质量的检查。
5.25 现代化的数据仓库有哪些核心诉求(数据的安全性、核心业务的效能、数据的规模与计算力的成本)
5.26 关于APM产品特性描述错误的是(可以使用按年计费的性能写入Iindexing Service服务)
5.27 传统机器学习模型很多,(线性回归)算法不属于分类算法
5.28 数据质量使用自定义SQL规则,如果选择校验类型为波动率型,则需要设置波动值的(橙色阈值,红色阈值),可以通过拖动进度条来设置,也可以直接输入阈值
5.29 为了使用单机调度的灵活性,holo-flow采用了(分布式)调度框架
5.30 Kappa架构的缺点:流式处理对于历史数据高吞吐量力不从心
5.31 派生指标是指(用于汇总表的字段,由原子指标、时间周期、修饰词 (可选)组成)
5.32 akehouse 概念由 Darabricks 公司提出的一种新的数据技术架构,它在数据湖的基础之上,吸收了数据仓库,数据库的一些特性,最核心的一个特性是对ACID的支持。Lakehouse方案简化了整个数据链路,并提高了数据链路的定时性,Lakehouse采用的是(Kappa)架构
5.33 (时态表Join)可以当两个表之间相关的数据出现乱序和时间偏差的情况下,能够提供正确的、确定性的结果
5.34 阿里云数据湖构建(Data Lake Formation,简称 DLF)是一款全托管的快速帮助用户构建云上数据湖及Lakehouse的服务,(text)是其元数据抽取不支持的格式
5.35 Lambda的大致思路是以传统的离线仓库为主,引入了实时数据的处理链路。 Lambda架构存在着哪些核心痛点:一种逻辑两套代码,开发运维难、实时和批量结果不一致引起的冲突
5.36 在大数据业务场景中Hive主要用于(提取、转换和加载)场景--不包含资源管理
5.37 新一代技术理念HSAP(Hybrid Serving/Analytics Processing)分析、服务一体化,统一数据服务层,旨在通过一套系统支持高QPS在线服务场景和实施OLAP多维分析,(分布式)符合一站式大数据HSAP系统的主要特点
5.38 工程师小明非常熟悉开源大数据平台,由于公司业务发展迅速。同时也为了节約成本,需要把自建大数据平台迁移到云上。(E-MapReduce)能让小明学习成本最小
5.39 云账号认证使用消息签名机制,可以保证消息在传输过程中的(真实性)和(完整性)
5.40 ABC电商公司非常关心用户从浏览到下单到支付的转化率,他们想分析不同性别的人在该流程中的转化率的差异,可以通过(对比漏斗)很好的实现该需求
6.ElasticStach
6.1 ElasticStach生态中,Kibana是灵活的数据分析和可视化工具,支持(多用户)登录。
6.2 通过REST API查询Elasticsearch文档时,通过(quary-string)语法将用户输入关键词发送给Elasticsearch
6.3 Elasticsearch是基于Lucene的底层查询并作优化,其内核查询性能优化主要有(预读、按列查询、wisp协程技术)方式--不包括执行聚合操作
6.4 在阿里云Elasticsearch实例创建过程中,地域和可用区:保持跟应用一致
6.5 在使用Elasticsearch进行数据查询时,对于数据不是很多的索引,为了提高检索性能,对于小规模索引(例如小于30GB),建议合并成1个,检索不会跨分片,跨节点,跨网络,大大提高了检索性能。
6.6 在阿里云ElasticSearch DSL 中,关于 ElasticSearch 别名,生产环境建议给每个索引都配置别名,创建索引 my_index_v1,配置别名my_index实现方式为 :PUT/my_index_v1/_alias/my_index,没要求索引别名唯一,和不能重复
6.7 阿里云Elasticsearch中有很多基础概念,阿里云Elasticsearch中节点类型分为两类--不止两类;一个服务器构成一个节点
6.8 了解了阿里云Elasticsearch 的使用方法后,可以执行如下命令DELETE /product_info,删除对应索引,避免浪费资源,使用DELETE可以删除索引,那么DELETE请求的功能有(删除整个索引、删除指定主键的文档)
6.9 (在特定业务场景领域表现优异)不是开源版Elasticsearch与其他产品相比的优势
6.10 使用Elasticsearch DSL查询语法可以对数据进行查询,FIND请求指定索引/名称,_search,对于date, keyword类型字段不支持range范围查询:这个描述是不正确的。首先,Elasticsearch中的查询请求应该是使用GET或POST,而不是FIND。其次,对于date和keyword类型的字段,Elasticsearch确实支持range查询,允许用户查询在特定范围内的值。
6.11 关于 Solr 与 Elasticseach 的描述,Solr 是 Apache Lucene 子项目,Elasticseach是构筑在Lucene 之上的上层应用
6.12 从自建Elasticsearch至阿里云Elasticsearch的数据迁移方案中,正确的是(用Logstash根据时间戳迁移增量数据)
7.Flink
7.1 Flink半托管/EMR:即阿里云E-MapReduce上的Dataflow集群,全托管Flink不是这样
7.2 在进行资源配置时,建议Source节点并发度和分区数乘比例配置,例如Kafka有16个分区,则并发度建议设置为16、8或4,这样做的原因是(避免数据倾斜)
7.3 任务运行的过程中,我们需要查看作业性能,然后通过配置参数来进行调优,(IO吞吐)不是阿里云实时计算支持的性能参数的查看
7.4 (attack query in 1 minute)指标不是阿里云实时计算Flink支持的
7.5 RANGE OVER Window:具有相同时间值的所有元素行视为同一计算行,即具有相同时间值的所有行都是同一个窗口
7.6 阿里云实时计算SQL中,声明表的字段映射根据外部数据源是否有Schema,可以分为(名称映射、顺序映射)类别
7.7 DataHub是阿里云流式数据(Streaming Data)的处理平台。数据上传至DataHub后保存在指定Topic内,后续会在5分钟内可以使用(contab)的形式同步到MaxComputed(离线)表,供计算使用
7.8 阿里云实时计算可以通过监控指标来分析作业数据是否正常。通过各类指标可以对作业运行情况进行一键式诊断,展示作业运行的各项核心指标,(SLA)不是阿里云实时计算支持的监控指标
7.9 阿里云实时计算Flink可以在控制台查看日志,(启动日志、运行日志)是支持在控制台查看的
7.10 大数据组件中,可用作搭建实时计算链路的是(Flink、Kafka)--Redis不行
7.11 Apache Flink有提供高吞吐、高延时的计算能力--错,低延迟
7.12 阿里云实时计算Flink 支持的报警渠道(SMS、Email、DingTalk)--不包含微信
7.13 实时计算SQL是阿里云实时计算为简化计算模型,降低用户使用实时计算门槛而设计的一套符合标准SQL语义的开发语言。(update)不符合阿里云实时计算语法
8.Hologres
8.1 在 Hologres 的执行引擎中,(SQE) 专门用于无缝对接 MaxCompute(ODPS)的执行引擎,实现对 MaxCompute 表的本地直读访问,无需数据迁移,支持高性能、全兼容地查询包括 Hash/Range Clustered Table 在内的各类复杂表结构,适用于 PB 级离线数据的交互式分析
8.2 可以将数据类型为int、float、Double、Array 的列,设置为 clustering_key--错误,对于行存表,默认主键为clustering key。 必须为not nullable的列或者列组合,不支持Float、Double、Array、Json及其他复杂数据类型。
更多推荐
所有评论(0)