【发布时间】:2019-02-16 04:34:13
【问题描述】:
我在 hive 中创建了一个外部分区表。
在日志中它显示 numinputrows。这意味着查询正在工作并正在发送数据。但是当我使用直线和查询连接到蜂巢时,select * or count(*) 它总是空的。
def hiveOrcSetWriter[T](event_stream: Dataset[T])( implicit spark: SparkSession): DataStreamWriter[T] = {
import spark.implicits._
val hiveOrcSetWriter: DataStreamWriter[T] = event_stream
.writeStream
.partitionBy("year","month","day")
.format("orc")
.outputMode("append")
.option("compression", "zlib")
.option("path", _table_loc)
.option("checkpointLocation", _table_checkpoint)
hiveOrcSetWriter
}
可能是什么问题?我无法理解。
【问题讨论】:
标签: apache-spark hive apache-spark-sql