【发布时间】:2019-01-28 19:45:11
【问题描述】:
我有两张大桌子。我在 Spark sql 中加入这两个表,比如
select * from table1 A Join table2 B on(A.client=B.client,A.sitecode=B.sitecode,A.spec_nbr=B.spec_nbr).
表 1 的数据有偏差,使查询运行时间更长。我想通过使用盐渍技术来避免歪斜的数据。
对于这种情况如何应用加盐技术?
我找不到任何有关如何应用盐渍技术的相关材料。任何帮助表示赞赏。
【问题讨论】:
-
这能回答你的问题吗? Skewed dataset join in Spark?
标签: scala apache-spark-sql skew