Hive:聚合函数

函数名称:stddev

用途:计算总体标准差

格式:T stddev(T,T,T,...)

函数名称:stddev_samp

用途:计算样本标准差

格式:T stddev_samp(T,T,T,...)

函数名称:variance

用途:返回组内某个数字列的方差

接口格式:DOUBLE variance(column name)

函数名称:var_pop

用途:返回组内某个数字列的方差

接口格式:DOUBLE var_pop(column name)

函数名称:var_samp

用途:返回组内某个数字列的无偏样本方差

接口格式:DOUBLE var_samp(column name)

函数名称:stddev_pop

用途:返回组内某个数字列的标准差

格式:DOUBLE stddev_pop(column name)

函数名称:covar_pop

用途:返回组内两个数字列的总体协方差

格式:DOUBLE covar_pop(col1,col2)

函数名称:covar_samp

用途:返回组内两个数字列的样本协方差

格式:DOUBLE covar_samp(col1,col2)

函数名称:corr

用途:返回组内两个数字列的皮尔逊相关系数

格式:DOUBLE corr(col1,col2)

函数名称:collect_set

用途:返回消除了重复元素的数组

格式:array collect_set(column name)

函数名称:collect_list

用途:返回允许重复元素的数组

格式:array collect_list(column name)

函数名称:ntile

用途:该函数将已经排序的分区分到x个桶中,并为每行分配一个桶号。这可以容易的计算三分位,四分位,十分位,百分位和其它通用的概要统计

格式:INTEGER ntile(INTEGER)

函数名称:percentile

用途:返回组内某个列精确的第p位百分数,p必须在0和1之间

格式:DOUBLE percentile(BIGINT,DOUBLE)

 

 

 

 

Hive 支持多种聚合函数,如 COUNT、SUM、AVG、MAX、MIN 等。使用聚合函数可以对表中的数据进行统计和分析。 以下是使用 Hive 实现聚合函数的语法: ``` SELECT function(column_name) FROM table_name WHERE condition GROUP BY column_name; ``` 其中,function 是聚合函数名称,column_name 是要进行聚合操作的列名,table_name 是表名,condition 是筛选条件,GROUP BY 子句用于分组聚合。在 GROUP BY 子句中指定的列名将会根据相同的值进行分组,然后对每个分组应用聚合函数。 举个例子,如果我们要统计每个部门的员工人数和平均工资,可以使用以下语句: ``` SELECT department, COUNT(*) AS count, AVG(salary) AS avg_salary FROM employee GROUP BY department; ``` 这里使用了 COUNT 和 AVG 两个聚合函数,分别统计了每个部门的员工人数和平均工资,并使用 AS 关键字对列名进行了重命名。 需要注意的是,在使用聚合函数时,除了使用 GROUP BY 子句进行分组聚合外,还可以使用 HAVING 子句进行筛选。HAVING 子句用于在分组后对分组进行筛选,只返回符合条件的分组。例如,如果我们只想返回员工人数大于等于 5 的部门信息,可以使用以下语句: ``` SELECT department, COUNT(*) AS count FROM employee GROUP BY department HAVING count >= 5; ``` 这里使用了 COUNT 聚合函数统计了每个部门的员工人数,并在 HAVING 子句中对 count 进行了筛选。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值