【问题标题】:Spark streaming from hive table, is it possible?来自蜂巢表的火花流,有可能吗?
【发布时间】:2017-10-10 10:16:18
【问题描述】:

我有一个用例

  1. 我们有 java 框架,每半小时将实时数据从 Kinesis 解析到 Hive 表。
  2. 我需要访问这个配置单元表并进行一些接近实时的处理。延迟一小时没问题,因为我没有访问 Kinesis 流的权限。
  3. 在 spark(最好是 pyspark)中完成处理后,我必须创建一个新的 kinesys 流并推送数据。
  4. 然后我将使用 Splunk 并将其拉近实时。

问题是,有人用 python 从 hive 完成 spark 流式传输吗?我必须先做 POC,然后再做实际工作。

我们将不胜感激。

提前致谢!!

【问题讨论】:

  • 我使用自动生成的日志文件触发了流式传输。
  • 您可以直接使用spark,就好像您不必在本地保存数据..处理流和从spark发送流..

标签: hive pyspark spark-streaming


【解决方案1】:

有两种方法可以解决这个问题:

  1. 使用火花流直接从 Kinesis 获取消息。这会给你一些实时的东西。

  2. 一旦文件落入您的暂存区域(您的 Hive 仓库或您的某个 HDFS 位置),您就可以使用 spark-streaming 对文件进行处理。

请告诉我们哪种方法最适合您。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2019-08-15
    • 2020-09-01
    • 2021-11-10
    • 2021-10-23
    • 2021-09-05
    • 2017-09-29
    • 1970-01-01
    相关资源
    最近更新 更多