【发布时间】:2016-08-11 15:51:58
【问题描述】:
我正在编写一个查询以从表 A 中获取满足表 B 中记录条件的记录。例如:
表 A 是:
Name Profession City
John Engineer Palo Alto
Jack Doctor SF
表 B 是:
Profession City NewJobOffer
Engineer SF Yes
我有兴趣获得表 c:
Name Profession City NewJobOffer
Jack Engineer SF Yes
我可以通过两种方式使用 where 子句或连接查询,哪一种更快,为什么在 spark sql 中? 比较列的where子句添加选择那些记录或加入列本身,哪个更好?
【问题讨论】:
-
我注意到 WHERE 和 ON 给出不同的结果
标签: scala apache-spark apache-spark-sql rdd spark-dataframe