【问题标题】:Increase in HBASE DB Size after test run测试运行后增加 HBASE DB 大小
【发布时间】:2012-10-10 08:00:55
【问题描述】:

我使用的是 HDFS+HBASE。我创建了一个数据库并运行了 2 个小时的测试。我想在测试运行后检查数据库大小的增加。 我尝试使用以下方法进行读数:

hadoop dfsadmin -report and
hadoop fs -dus /hbase.

还尝试使用

检查磁盘大小
du -sk /HADOOP.

观察是在测试运行后,大小显示减少而不是增加。

正在使用的版本:Hadoop 1.0.0、HBase 0.90.5、ZooKeeper 3.3.4。
列族的压缩是 NONE。

请帮助获得正确的过程来计算由于测试而增加的数据库大小。

【问题讨论】:

  • 你运行什么样的测试?你确定,你不会在运行之间截断表吗?写入了多少数据?
  • 这是一个负载测试。运行之间不进行表截断。写入的数据约为 650K 事务/小时。
  • 你确定你不在独立模式下运行 hbase 吗? (因为几乎不可能看不到任何活动,特别是如果我们考虑到 hbase 只附加数据)
  • 它不是独立的。它是集群环境。有 3 个数据节点。
  • 我只能建议一种方案:您将相同的数据放入 hbase 和 compaction accours。如果您使用versions=1 创建的表,则会消除第二个数据副本(当然,如果它不是随机的)。

标签: hadoop hbase cluster-computing hdfs


【解决方案1】:

Lakshmi,650K 对于 HBase / Hadoop 来说不算什么。默认起始块大小为 128M(如果我没有错过一些重大更改),因此在创建表后您应该看不到任何重要内容。实际上,您的表(HStore 文件)应该位于 /hbase/<table-name> 下,区域内容位于 /hbase/<table-name>/<region> 下(您可以通过 HBase Web UI 查看区域信息)。

如果你真的需要检查一些东西,至少加载超过 128M 的数据。我通常至少做 4G DB 来测试区域分配。当前默认(从 HBase 0.94 开始)区域拆分策略从填充的第一个 128M 开始拆分区域,然后这种情况越来越少。

【讨论】:

    猜你喜欢
    • 2013-09-10
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-06-29
    • 1970-01-01
    • 1970-01-01
    • 2014-12-18
    • 1970-01-01
    相关资源
    最近更新 更多