【发布时间】:2017-01-03 10:44:01
【问题描述】:
Dataframe A(百万条记录)的一列是create_date,modified_date
Dataframe B 500 记录有 start_date 和 end_date
目前的做法:
Select a.*,b.* from a join b on a.create_date between start_date and end_date
上述作业需要半小时或更长时间才能运行。
如何提高性能
【问题讨论】:
-
考虑广播数据帧 B。请参阅此相关问题 stackoverflow.com/a/34932092/2843520
-
我们可以在sql语句中使用广播吗?
标签: scala apache-spark cassandra datastax-enterprise