【问题标题】:How to optimise pyspark approxSimilarityJoin for 2 very large data frames如何针对 2 个非常大的数据帧优化 pyspark approxSimilarityJoin 【发布时间】:2019-11-28 11:19:13 【问题描述】: 我想根据它们的相似性加入两个巨大的数据框。我尝试使用近似连接。然而,任务在一段时间后卡住并最终失败。 【问题讨论】: 标签: join pyspark similarity approximate 【解决方案1】: 有多种方法: 增加集群大小 如果一个数据集比另一个小很多,则使用广播连接 使用阻塞技术 如果该选项可用,请使用 Deltalakes 【讨论】: 谢谢罗伯。我仍然很困惑,因为我是第一次使用 spark。你所说的阻塞技术是什么意思。另外,我不能使用广播连接,因为两个数据帧都很大。