【发布时间】:2015-11-18 04:20:33
【问题描述】:
为了将大型 SQL 数据加载到 Spark 以进行转换和机器学习,以下哪个选项在性能方面更好。
选项 1:使用 Spark SQL JDBC 连接器将 SQLData 直接加载到 Spark。
选项 2:使用 Sqoop 以 csv 格式将 SQLData 加载到 HDFS,然后使用 Spark 从 HDFS 读取数据。
请建议以上哪种方法可以将大型 SQL 数据加载到 Spark。
【问题讨论】:
标签: apache-spark apache-spark-sql