【问题标题】:How to optimise pyspark approxSimilarityJoin for 2 very large data frames如何针对 2 个非常大的数据帧优化 pyspark approxSimilarityJoin
【发布时间】:2019-11-28 11:19:13
【问题描述】:

我想根据它们的相似性加入两个巨大的数据框。我尝试使用近似连接。然而,任务在一段时间后卡住并最终失败。

【问题讨论】:

    标签: join pyspark similarity approximate


    【解决方案1】:

    有多种方法:

    1. 增加集群大小
    2. 如果一个数据集比另一个小很多,则使用广播连接
    3. 使用阻塞技术
    4. 如果该选项可用,请使用 Deltalakes

    【讨论】:

    • 谢谢罗伯。我仍然很困惑,因为我是第一次使用 spark。你所说的阻塞技术是什么意思。另外,我不能使用广播连接,因为两个数据帧都很大。
    猜你喜欢
    • 1970-01-01
    • 2021-09-26
    • 2015-03-15
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多