【问题标题】:Incremental data load in hbasehbase 中的增量数据加载
【发布时间】:2016-06-10 11:28:06
【问题描述】:

我正在寻找将增量数据(基于源表的时间戳)加载到我的表中的最佳方式。我有一个源表(在 hbase 中),其中的数据每天都会更新。在第一个流程中,我必须将完整数据传输到我的测试表(在 hbase 中)。第二天,我只需要从源表中传输新添加的记录。为此,我将使用时间戳来区分需要传输和不需要传输的内容。那么什么是最好的转移方式。我应该使用 PIG、MapReduce 还是 Spark?

【问题讨论】:

    标签: apache-spark mapreduce timestamp hbase apache-pig


    【解决方案1】:

    您是否考虑过使用像org.apache.hadoop.hbase.mapreduce.CopyTable 这样的现有类?它们支持增量复制。

    无需编写代码。

    【讨论】:

    • 我读到了使用复制表的增量数据加载。但我找不到任何例子。你能给我一个使用 copytable 进行增量加载的例子吗?
    • 所以这个想法是你使用开始时间和结束时间。 1. hbase org.apache.hadoop.hbase.mapreduce.CopyTable --new.name=tableCopy tableOriginal --starttime=1 --endtime= 1465735288000 然后 2. hbase org.apache.hadoop.hbase.mapreduce.CopyTable -- new.name=tableCopy tableOriginal --starttime= 1465735288000 --endtime=1465821688000 所以你需要计算你完成的位置。
    猜你喜欢
    • 2013-09-10
    • 1970-01-01
    • 1970-01-01
    • 2020-12-27
    • 2023-01-31
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多