【发布时间】:2017-10-10 10:16:18
【问题描述】:
我有一个用例
- 我们有 java 框架,每半小时将实时数据从 Kinesis 解析到 Hive 表。
- 我需要访问这个配置单元表并进行一些接近实时的处理。延迟一小时没问题,因为我没有访问 Kinesis 流的权限。
- 在 spark(最好是 pyspark)中完成处理后,我必须创建一个新的 kinesys 流并推送数据。
- 然后我将使用 Splunk 并将其拉近实时。
问题是,有人用 python 从 hive 完成 spark 流式传输吗?我必须先做 POC,然后再做实际工作。
我们将不胜感激。
提前致谢!!
【问题讨论】:
-
我使用自动生成的日志文件触发了流式传输。
-
您可以直接使用spark,就好像您不必在本地保存数据..处理流和从spark发送流..
标签: hive pyspark spark-streaming