【问题标题】:Best way to handle medium for large dataset处理大型数据集的最佳方法
【发布时间】:2020-11-04 14:17:46
【问题描述】:

我正在使用 spark 为大型数据集寻找介质,大约 (300PB)。优化的最佳方法是什么? (顺便说一句,结果不必严格准确)

【问题讨论】:

标签: apache-spark quantile


【解决方案1】:

您可以通过两种方式解决此问题: 1-使用 meanApprox(long timeout, double confidence) 函数返回超时和置信度内的近似平均值。

2-你可以使用 Sample(double fraction, boolean withReplacement, long seed, SparkPlan child) 实现您的目的的方法,例如:

sampledRDD = rdd.sample(False, sample, seed)
approxMean = sampledRDD.mean()

我希望这能解决您的问题。 更多详情,您可以访问https://spark.apache.org/docs 了解更多信息。

【讨论】:

  • 是否找到样本的中位数会为您提供与整个数据集相似的数字。如何确保它们相似?
  • 对于“mean”、“count”和“sum”,我们可以提供与样本大小相关的置信度,但对于中位数,这取决于您的数据是否已排序。
  • 为什么排序或不重要?有什么区别?
猜你喜欢
  • 2016-09-28
  • 1970-01-01
  • 1970-01-01
  • 2013-11-11
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2023-03-21
相关资源
最近更新 更多