【问题标题】:Impala median calculation on big data大数据的 Impala 中值计算
【发布时间】:2023-03-29 03:58:01
【问题描述】:

我可以访问任何给定月份的数亿行数据。 3个特征:字符串表示日期,字符串表示类型,值表示金额。

可以使用 python 和 impala(SQL),计算每个月每种类型的数百万行中位数的最佳方法是什么?

如果我使用简单的 group by :日期部分的类型和子字符串来获取月份,例如 substring(date,1,4) 并使用 APPX_MEDIAN 函数作为中位数,我最终会耗尽内存Impala 查询。

如果我尝试将原始数据作为 CSV 格式(例如使用 DBeaver),它会非常大 - GB 大小,太大而无法放入我可以访问的 VM 的内存中,如果我尝试,它将保存 CSV将其推送到 python pandas 数据帧中。

我不熟悉处理大数据的模式,因此非常感谢任何提示。由于数据的庞大,我正在努力执行简单的计算。

【问题讨论】:

    标签: python pandas impala median impyla


    【解决方案1】:

    您可以尝试通过指定SET MEM_LIMIT=Xg 来增加 Impala 用于执行查询的内存量,其中 X 表示 每个 Impala 守护程序的内存量,以 GB 为单位。更多详情请参阅https://impala.apache.org/docs/build/html/topics/impala_mem_limit.html

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2023-03-16
      • 1970-01-01
      • 2019-11-07
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多