【发布时间】:2014-12-02 01:21:53
【问题描述】:
是否可以将 Microsoft Sql Server(以及 oracle、mysql 等)中的数据读取到 Spark 应用程序中的 rdd 中?还是我们需要创建一个内存集并将其并行化为 RDD?
【问题讨论】:
-
这肯定没有答案:P
-
似乎如此......为什么?如果它可以从所有东西中收集数据,为什么不是最常见的商店?
-
您将不得不等待几天才能得到答案,因为标签
apache-spark被非常郑重地使用。等待几天让 apache 人员回答您的问题。 -
您当然可以将数据读入驱动程序,然后将其并行化到 RDD 中。如果您正在寻找更具可扩展性的解决方案,您可能希望考虑将
DBInputFormat与 Spark 的“Hadoop API”方法一起使用。我以前没有这样做过,但看起来很值得研究。
标签: sql apache-spark apache-spark-sql