【发布时间】:2018-02-16 07:58:25
【问题描述】:
我想在 Hive 中模拟 BigQuery 的 QUANTILES 函数。
数据集:1,2,3,4
BigQuery 的查询结果将返回值 2
选择第 n(2, quantiles(col1, 3))
但在 Hive 中:
选择百分位数(col1, 0.5)
我有 2.5
注意:对于奇数条记录,我得到了相同的结果。
是否有足够的 Hive 的 udf 功能?
【问题讨论】:
-
QUANTILES是一个统计近似值。将标准 SQL 与 BigQuery 一起使用时的类似物称为APPROX_QUANTILES。如果 Hive 给你一个准确的值,你为什么要一个近似的中位数? -
感谢 Elliott 的快速回复。对于我的用例,我得到了更好的结果,近似中位数。据我了解,Hive 中没有 approx_quantiles 函数。
标签: hadoop apache-spark hive google-bigquery quantile