【问题标题】:send this spark streaming dataframe to hbase using scala使用 scala 将此火花流数据帧发送到 hbase
【发布时间】:2016-12-16 07:46:13
【问题描述】:

我在火花流中接收 kafka 并处理我的数据以创建如下所示的数据帧:

+---+-------------------------+--------------------------------------------------------------------------------------------------------------------------------------------------------------+
|id |sen                      |attributes                                                                                                                                                    |
+---+-------------------------+--------------------------------------------------------------------------------------------------------------------------------------------------------------+
|1  |Stanford is good college.|[[Stanford,ORGANIZATION,NNP], [is,O,VBZ], [good,O,JJ], [college,O,NN], [.,O,.], [Stanford,ORGANIZATION,NNP], [is,O,VBZ], [good,O,JJ], [college,O,NN], [.,O,.]]|
+---+-------------------------+--------------------------------------------------------------------------------------------------------------------------------------------------------------+

我有带有列 id 和 att 的 hbase 表“kafkaStreaming”。我希望这些数据以“ID”作为行键和属性保存在 hbase 中,例如 att 中的 [[Stanford,ORGANIZATION,NNP], [is,O,VBZ], [good,O,JJ]]。

我想在这些数据到来时动态添加列族。请帮忙。

【问题讨论】:

  • 我想知道如何将其转换为 PUT 对象以将它们注入 HBASE

标签: scala hbase apache-kafka spark-streaming


【解决方案1】:

我们在Splice Machine 有这方面的示例代码

如果您想尝试写入低级别位,您可以动态创建 HBase Put 并通过函数调用或 OutputFormat 运行它们。 Put 语法允许任意数量的列族。

在这种方法下,故障语义往往不会那么热门。你如何回滚失败等?

【讨论】:

  • 有道理。我们的代码都在 java 中(没有帮助)。 Cloudera 有一些开源代码位于此处github.com/cloudera-labs/SparkOnHBase。他们有一些用于与 Hbase 交互的最小 scala 代码。希望这会有所帮助。
猜你喜欢
  • 2016-10-06
  • 2019-05-12
  • 2016-05-01
  • 2018-11-08
  • 2022-01-23
  • 1970-01-01
  • 2018-10-27
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多