【发布时间】:2020-11-04 14:17:46
【问题描述】:
我正在使用 spark 为大型数据集寻找介质,大约 (300PB)。优化的最佳方法是什么? (顺便说一句,结果不必严格准确)
【问题讨论】:
-
你的意思是,中位数?
-
希望对您有所帮助 - stackoverflow.com/questions/31432843/…
标签: apache-spark quantile
我正在使用 spark 为大型数据集寻找介质,大约 (300PB)。优化的最佳方法是什么? (顺便说一句,结果不必严格准确)
【问题讨论】:
标签: apache-spark quantile
您可以通过两种方式解决此问题: 1-使用 meanApprox(long timeout, double confidence) 函数返回超时和置信度内的近似平均值。
2-你可以使用 Sample(double fraction, boolean withReplacement, long seed, SparkPlan child) 实现您的目的的方法,例如:
sampledRDD = rdd.sample(False, sample, seed)
approxMean = sampledRDD.mean()
我希望这能解决您的问题。 更多详情,您可以访问https://spark.apache.org/docs 了解更多信息。
【讨论】: