【问题标题】:How to read data from HBase table using pyspark?如何使用 pyspark 从 HBase 表中读取数据?
【发布时间】:2020-01-27 22:44:26
【问题描述】:

我创建了一个名为 emp 的虚拟 HBase 表,其中包含一条记录。以下是数据。

> hbase(main):005:0> put 'emp','1','personal data:name','raju' 0 row(s)
> in 0.1540 seconds
> hbase(main):006:0> scan 'emp' ROW 
> COLUMN+CELL  1                                       column=personal
> data:name, timestamp=1512478562674, value=raju 1 row(s) in 0.0280
> seconds                                  

现在我已经使用shcHBasepySpark 之间建立了连接。你能帮我把上面的HBase table读成dataframePySpark中的代码吗?

版本详情:

Spark Version 2.2.0, HBase 1.3.1, HCatalog 2.3.1

【问题讨论】:

    标签: apache-spark pyspark hbase


    【解决方案1】:

    你可以这样试试

    pyspark --master local --packages com.hortonworks:shc-core:1.1.1-1.6-s_2.10 --repositories http://repo.hortonworks.com/content/groups/public/ --files /etc/hbase/conf.cloudera.hbase/hbase-站点.xml

    empdata = ''.join("""
        {
            'table': {
                'namespace': 'default',
                'name': 'emp'
            },
            'rowkey': 'key',
            'columns': {
                'emp_id': {'cf': 'rowkey', 'col': 'key', 'type': 'string'},
                'emp_name': {'cf': 'personal data', 'col': 'name', 'type': 'string'}
            }
        }
    """.split())
    
    df = sqlContext \
        .read \
        .options(catalog=empdata) \
        .format('org.apache.spark.sql.execution.datasources.hbase') \
        .load()
    
    df.show()
    

    [更多信息请参阅此博客]

    https://diogoalexandrefranco.github.io/interacting-with-hbase-from-pyspark/

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-01-26
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2013-05-13
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多