logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

hive中日期和字符串的转换

hive中日期和字符串之间的转换

#数据库#hive
pandas中的groupby 和 agg组合运用,新生成的列重命名

product_id 是 Product 表的外键(reference 列)。product_id 是该表的主键(具有唯一值的列)。该表的每一行包含关于一个销售的一些信息。该表的每一行显示每个产品的名称和价格。这个表可能有重复的行。(含)之间出售的商品。

#pandas
pandas.DataFrame.pivot

月份(month)可以取下列值 ["Jan","Feb","Mar","Apr","May","Jun","Jul","Aug","Sep","Oct","Nov","Dec"]。index:指定一列做为生成DataFrame对象的索引,如果为空则默认为原来的索引。pivot函数用于从给定的表中创建出新的派生表,pivot有三个参数:索引、列和值。请注意,结果表共有 13 列(1 列用于部门 ID

#pandas#机器学习#数据挖掘
hive中将文本拆分为键值对str_to_map()

str_to_map(字符串参数, 分隔符1, 分隔符2)分隔符1将文本分成K-V对,分隔符2分割每个K-V对。对于分隔符1默认分隔符是',',对于分隔符2默认分隔符是'='。举例user_idtag_value162@2021-11-28292@2021-11-28#93@2021-11-29398@2001-1-17select user_id,str_to_map(tag_value,'#'

#hadoop#big data#大数据
SQL 窗口函数之lead() over(partition by ) 和 lag() over(partition by )

lag() over() 与 lead() over() 函数是跟偏移量相关的两个分析函数,通过这两个函数可以在一次查询中取出同一字段的前 N 行的数据 (lag) 和后 N 行的数据 (lead) 作为独立的列, 从而更方便地进行进行数据过滤。这种操作可以代替表的自联接,并且 LAG 和 LEAD 有更高的效率。over() 表示 lag() 与 lead() 操作的数据都在 over() 的范

文章图片
#sql#数据库
到底了