【发布时间】:2017-11-23 10:47:51
【问题描述】:
在 Apache Spark 中有没有一种方法可以创建一个 Spark SQL代理表,它只是代理到底层(自定义)数据源?
我有一个自定义数据源,它通过实现org.apache.spark.sql.sources.PrunedFilteredScan 支持谓词下推,现在我想对该数据源使用 Spark SQL,其中过滤谓词通过(下推)到数据源。将数据源注册为普通临时表(使用sqlContext.read.format("mydatasource").load().createOrReplaceTempView("myTable"))不是一种选择,因为这最终会将所有数据拉入 Spark。
【问题讨论】:
-
“因为这最终会将所有数据拉入 Spark。” 您能否详细说明您是如何检查的和/或是什么让您认为会发生这种情况?
标签: apache-spark apache-spark-sql