【发布时间】:2019-10-03 11:34:10
【问题描述】:
我在加入大量列时遇到了问题。
我有 270 个具有相同数据架构的数据输出。而且270个输出需要join到一个大表中,有什么方法可以优化join吗?现在要花很多时间。
目前,我们使用A.join(B,'userid')。谢谢你。
Table like this
【问题讨论】:
-
架构是这样的:userid: int, type_X_count: int。每个数据输出的行数相同。 'type_X_count' 中的 'X' 在每个数据输出中都不同。
标签: join pyspark apache-spark-sql