【问题标题】:Spark Streaming with Hbase使用 Hbase 进行 Spark 流式传输
【发布时间】:2017-05-26 09:14:19
【问题描述】:

我正在尝试从 hbase 获取数据,对于所有我发现要拥有 Hbase 的数据我必须通过 Kafka 的教程,是否可以在不包括链中包含 Kafka 的情况下直接在 spark 流和 hbase 之间进行集成 谢谢。

【问题讨论】:

  • 是的,因为我们在不使用 kafka 的情况下也做了同样的事情。见下面的例子

标签: apache-spark hbase bigdata


【解决方案1】:

spark 流和 hbase 是否可以集成 直接不包括Kafka

是的.. 有可能,因为我们在不使用 kafka 的情况下也做了同样的事情。 看下面的例子JavaHBaseStreamingBulkPutExample

package org.apache.hadoop.hbase.spark.example.hbasecontext;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.hbase.HBaseConfiguration;
import org.apache.hadoop.hbase.TableName;
import org.apache.hadoop.hbase.client.Put;
import org.apache.hadoop.hbase.spark.JavaHBaseContext;
import org.apache.hadoop.hbase.util.Bytes;
import org.apache.spark.SparkConf;
import org.apache.spark.api.java.JavaSparkContext;
import org.apache.spark.api.java.function.Function;
import org.apache.spark.streaming.Duration;
import org.apache.spark.streaming.api.java.JavaReceiverInputDStream;
import org.apache.spark.streaming.api.java.JavaStreamingContext;

/**
 * This is a simple example of BulkPut with Spark Streaming
 */
final public class JavaHBaseStreamingBulkPutExample {

  private JavaHBaseStreamingBulkPutExample() {}

  public static void main(String[] args) {
    if (args.length < 4) {
      System.out.println("JavaHBaseBulkPutExample  " +
              "{host} {port} {tableName}");
      return;
    }

    String host = args[0];
    String port = args[1];
    String tableName = args[2];

    SparkConf sparkConf =
            new SparkConf().setAppName("JavaHBaseStreamingBulkPutExample " +
                    tableName + ":" + port + ":" + tableName);

    JavaSparkContext jsc = new JavaSparkContext(sparkConf);

    try {
      JavaStreamingContext jssc =
              new JavaStreamingContext(jsc, new Duration(1000));

      JavaReceiverInputDStream<String> javaDstream =
              jssc.socketTextStream(host, Integer.parseInt(port));

      Configuration conf = HBaseConfiguration.create();

      JavaHBaseContext hbaseContext = new JavaHBaseContext(jsc, conf);

      hbaseContext.streamBulkPut(javaDstream,
              TableName.valueOf(tableName),
              new PutFunction());
    } finally {
      jsc.stop();
    }
  }

  public static class PutFunction implements Function<String, Put> {

    private static final long serialVersionUID = 1L;

    public Put call(String v) throws Exception {
      String[] part = v.split(",");
      Put put = new Put(Bytes.toBytes(part[0]));

      put.addColumn(Bytes.toBytes(part[1]),
              Bytes.toBytes(part[2]),
              Bytes.toBytes(part[3]));
      return put;
    }

  }
}

【讨论】:

  • 我在导入 org.apache.hadoop.hbase.spark.JavaHBaseContext 时遇到问题。我将 maven 依赖添加为这个 groupId - org.apache.hbase artifactId - hbase-spark version - 2.0.0-alpha4
  • 你的GitHub项目也被删除了
  • 请参考最新提出的新问题这是 2 岁
猜你喜欢
  • 1970-01-01
  • 2017-10-16
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2014-10-28
  • 1970-01-01
  • 2016-11-22
相关资源
最近更新 更多