percentile_approx函数用法

hive里面有个percentile函数和percentile_approx函数，其使用方式为percentile(col, p)、percentile_approx(col, p)，p∈(0,1)p∈(0,1)其中percentile要求输入的字段必须是int类型的，而percentile_approx则是数值类似型的都可以。其实percentile_approx还有一个参数B：percenti

六mo神剑

13270人浏览 · 2021-11-12 09:52:32

六mo神剑 · 2021-11-12 09:52:32 发布

hive里面有个percentile函数和percentile_approx函数，其使用方式为percentile(col, p)、percentile_approx(col, p)，p∈(0,1)p∈(0,1) 


其中percentile要求输入的字段必须是int类型的，而percentile_approx则是数值类似型的都可以。

其实percentile_approx还有一个参数B：percentile_approx(col, p，B)。参数B控制内存消耗的近似精度，B越大，结果的准确度越高。默认为10,000。当col字段中的distinct值的个数小于B时，结果为准确的百分位数。 

如果要求多个分位数，可以把p换为array(p1,p2,p3…p1,p2,p3…)，即

percentile_approx(col,array(0.05,0.5,0.95),9999)

如果不放心的话，就给col再加个转换： 

percentile_approx(cast(col as double),array(0.05,0.5,0.95),9999)percentile_approx(cast(col as double),array(0.05,0.5,0.95),9999)

其输出结果长这样：

[0.0,4001.0,4061.0]

参考这：
https://blog.csdn.net/qq_44426756/article/details/120218501?spm=1001.2101.3001.6650.1&utm_medium=distribute.pc_relevant.none-task-blog-2%7Edefault%7ECTRLIST%7Edefault-1.no_search_link&depth_1-utm_source=distribute.pc_relevant.none-task-blog-2%7Edefault%7ECTRLIST%7Edefault-1.no_search_link