1-270

1.MaxCompute

1.1 MaxCompute的JOIN操作分为左连接、右连接、全连接、内连接。支持多路连接,但不支持CROSS JOIN笛卡尔积,即无ON条件的连接

1.2 MaxCompute的控制层主要功能包括(用户空间和对象的管理、命令的解析、执行逻辑、数据对象的访问控制与授权)

1.3 表授权后重建,ACL授权会失效

1.4 (用户空间管理操作)不是由ODPS接入层提供的服务,ODPS(现称为MaxCompute)的接入层主要负责用户认证、HTTP请求处理、负载均衡(Load Balance)等服务。

1.5 (项目空间(Project)、资源(Resource) 、自定义函数(UDF)及实例(Instance))对象的操作不需要通过Maxcompute的任务(Task) 来完成

1.6 ODPS由(逻辑层、接入层、客户端、计算层)组成

1.7 Tunnel服务的公网endpoint是(http://dt.odps.aliyun.com

1.8 关于ODPS MR,map worker在输出数据时,需要为每一条输出数据指定一个key

1.9 对于ODPS DDL的操作,一般都是由(controller)层完成 

1.10 通过 setSplitSize 方法减少切分大小:该方法适用于 MapReduce 作业控制输入分片,不适用于 Graph 模型

1.11 在大数据计算服务 MaxComputeSQL中,可以通过(UPDATE、DELETE、INSERT OVERWRITE、INSERT INTO)语句处理表中的数据,但需注意:UPDATE 和 DELETE 有使用前提(必须是支持事务的表类型),而 INSERT INTO / OVERWRITE 是通用 DML 操作。

1.12 关于大数据计算服务( MaxCompute,原ODPS )中的ACL (访问控制列表)授权,授权或撤销授权时,对Subject(如User)有要求。即授权的User必须存在

1.13 大数据计算服务(MaxCompute, 原ODPS )的运维人员想要知道一张日志表log已经占用了多少存储空间,可以在命令行工具odpscmd中使用(desc log)命令查看。 

1.14 在开发大数据计算服务(MaxCompute,原ODPS )的MapReduce时,可以使用JobClient类中的接口提交MapReduce作业。目前提交方式支持 (阻塞方式、非阻塞方式)。

1.15 MaxCompute Graph支持以下图编辑操作: 修改点或边的权值。 增加、删除点。 增加、删除边。

1.16 用Java写ODPS的自定义函数时(long、string)类型是可以用在接口中的类型 

1.17 某用户拥有一个阿里云账号,现在想要创建数据工场DataWorks (原DatalDE)组织,并在组织中创建项目空间进行数据开发工作,该云账号必须是实名认证,有access id和access key且创建组织前该账号必须已经是某个MaxCompute project的owner

1.18 在大数据计算服务(MaxCompute, 原ODPS)图计算的迭代(SuperStep)过程中, 用户不可以进行(通过Dispatcher将全局信息分发到点或边)操作

1.19 MaxCompute 中的MapReduce中,一个map的输出结果可能会被分配到多个reduce上去

1.20 MaxCompute 的 INSERT OVERWRITE 语义:“不指定字段时,先清空目标表的全部数据,再插入新的数据。”

1.21 MaxCompute SQL 不支持 contains() 函数,该语法无效。

1.22 (DT task)不是加载数据到ODPS的合理方法

1.23 ODPS tunnel上传或者下载数据时,参数rd的默认取值是(\r\n)

1.24 MaxCompute的使用限制:单个任务引用的资源总计字节数不能超过64M

1.25 ODPS中负责对等待提交的task进行排序的模块是(scheduler)

1.26 大数据计算服务(MaxCompute,原ODPS )中的角色(Role)是一组访问权限的集合。删除一个角色时,会先检查该角色内是否还存在其他用户。若存在,则删除该角色失败

1.27 从Maxcompute(ODPS)导入到ADS中时,可以从(information_schema.job_instances)表中查询导入状态

1.28 ODPS通过云帐号服务器,对请求中的签名信息进行验证,返回(AccountlD)给HTTP Server

1.29 MaxCompute 的任务调度与执行架构通常包括 Scheduler(调度器)、Master(主控节点) 和 Worker(工作节点) 等组件

2.DataWorks

2.1 DataWorks中,通过运维中心的任务管理列表可以对任务进行一些批量修改,具体批量操作功能包括(添加报警、修改责任人、修改资源组),从而提高项目管理员管理调度任务的效率

2.2 大数据开发治理平台 DataWorks 中,重跑任务需要运维角色,开发角色无权重跑

2.3 在 DataWorks 中,暂停(冻结)操作可作用于周期任务或具体实例。若仅对某一天的自动调度实例(如 2022 年 4 月 9 日的实例)执行暂停操作,则 仅该实例被冻结 ,不影响其他日期的实例。

2.4 DataWorks数据管理的权限管理模块主要包括(待我审批、我已处理)管理

2.5 EMR属于云自建大数据平台的计算引擎不是BASE的任务类型

3.Hologres

4.AnalyticDB

4.1 查看ADS数据导入状态的方法:1、根据job_ids查询表information_schema.current_job 2、通过DMS导入导出菜单查看

4.2 对于ADS的主键,对于批量更新表,分析型数据库中主键的概念是弱化的,分析型数据库不要求一个表有主键,有主键的表的性能和用法上和没有主键的表之间没有任何区别。 当 updateType=realtime 时,对于不同主键数据的多次变更,ADS 不保证先执行的变更会比后执行的变更更优先的查询到;只保证最终一致。 

4.3 对于ADS的list分区,list分区为非动态分区,即分区值不由数据本身决定,而是每次导入时用户指定的

4.4 在数据工场DataWorks(原Data IDE)中,配置切分键后,数据同步任务可从单通道方式变成多通道方式进行,但是并不是所有数据源都支持配置切分键。不支持切分键配置数据源有(ADS)

4.5 对于ADS中表和表组,批量插入的表如果只有一级分区,每次导入数据是会覆盖掉已有数据

4.6 ADS创建表组时,可以指定表组的副本数,表组的副本数越多,可以一定程度的增加ADS的最大承受的QPS

4.7 关于ADS用户,支持ACL,不支持policy授权,不可以删除用户,可以回收用户

4.8 ADS的维度表组中存放的表的特点: 数据量较小、记录条数据不超过100万或者不大于1G

5.Tablestore

5.1 MD5 只能用于校验或去重,不能还原原始数据;简历中的照片、证书等需要被查看或下载,仅存 MD5 会丢失所有有效信息

5.2 OTS费用从(数据存储、预留读写吞吐量、外网下行流量)维度计量

5.3 OTS API 中单行操作不包括 (Postrow )

5.4 关于OTS中分片,一个分片可能包含多个分片键

5.5 OTS支持多种数据类型,不包括varchar

6.RDS/DRDS

6.1 RDS 中慢SQL包括(全表扫描、扫描数据量过大、磁盘排序)操作

6.2 关于RDS的使用,创建数据库时必须使用open api 或RDS管理控制台进行操作

6.3 若RDS用户需要立即备份RDS实例,可在不更改备份策略的情况下,对RDS实例进行临时备份,临时备份每天可触发次数是无限次

6.4 关于RDS开发,只能通过 HybridDB for MySQL管理控制台或OpenAPI进行物理备份,不支持支持第三方工具进行物理备份

7.OSS

8.Flink

8.1 blink开发默认的数据存储(RDS、ADS、Log Service、Datahub)

8.2 (ADS、LogHub)不可以作为blink流计算的源头(source)

9.Elasticsearch

10.机器学习及通用知识

10.1 (防WEB应用系统密码破解)不是安骑士包含的功能

10.2 公司的平台并不需要99%的在线率,做到10%即可满足业务要求。寻找一个更合适的替代方案,如果用云盾来满足这个需求,(安全网络)服务是最佳的

10.3 分类模型可以通过一些计算指标或者图表进行性能评估,用于分类模型评估的有(混淆矩阵、F1 score、ROC)

10.4 数据可视化分析平台Quick BI的数据门户不能用来做权限管理、报表分类和仪表盘设计

10.5 算法中通常用于聚类分析的是(DBSCAN)

10.6 关于阿里云机器学习中的组件读数据表与写数据表,两个组件都是只能读写MaxCompute

10.7 Quick BI由多个模块组成,每个模块提供不同的功能。其中(Query引擎)负责针对数据源的查询过程

10.8 (AliDL)不是阿里云机器学习支持多种深度学习框架

更多推荐