【发布时间】:2017-01-23 17:55:24
【问题描述】:
我正在实现一个使用 sqoop 将 MySql 数据导入 hdfs 的项目。它有近 30 个表。我通过推断模式将每个表作为数据框读取并注册为临时表。我在做这件事时有几个问题......
1.假设说 df1 到 df10 ,需要为表实现几个连接。在 MySQL 中,查询将是
select a.id,b.name,c.AccountName from accounts a priority b bills c where a.id=b.id and c.name=a.name
而不是使用
sqlContext.sql(select a.id,b.name,c.AccountName from accounts a priority b bills c where a.id=b.id and c.name=a.name)
是否有其他方法可以根据条件有效地连接所有数据框..
- 是将表转换为数据框并在其之上进行查询的正确方法,还是在 Spark 中处理此类连接和查询的更好方法?
【问题讨论】:
标签: scala apache-spark apache-spark-sql