【发布时间】:2018-10-16 17:23:35
【问题描述】:
我正在尝试在同一个 DataFrame 上按顺序加入一个 DataFrame (dfA)。
假设 dfA 有 id_x 和 id_y 列,而 dfB 有 id 列和其他一些列。
我想执行以下操作:
dfA.join(dfB, dfA("id_x") === dfB("id")).join(dfB, dfA("id_y") === dfB("id"))
我可以做任何重新分区或预处理来加快速度吗?
【问题讨论】:
标签: scala apache-spark join apache-spark-sql distributed-computing