【问题标题】:Replication vs Snapshot in HBaseHBase 中的复制与快照
【发布时间】:2016-01-28 00:48:58
【问题描述】:

我们有两个系统 - 一个离线系统(此处性能不重要),其中 MapReduce 作业在 HBase 集群上运行。另一个是在线系统(这里的性能非常关键),API 从同一个 HBase 集群中读取。但是由于 MapReduce 作业在同一个集群上运行,在线系统上存在性能问题。所以我们正在尝试为离线系统建立单独的 HBase 集群,这是从源集群复制几个姓氏。 所以在源头上运行繁重的 MapReduce 作业。在复制集群上,只有在线系统运行才能提供最佳性能。 我的问题是 :: 我们不能在 HBase 中使用快照功能来做同样的事情吗?我也想知道它们有什么区别?

【问题讨论】:

  • 这个article from Cloudera 详细介绍了快照,还列出了您的特定场景(用例列表中的最后一个).. 希望这会有所帮助

标签: hadoop mapreduce hbase cloudera


【解决方案1】:

如果您为 mapreduce 使用快照功能,它也会在实时 hbase 集群节点上花费 cpu、内存和磁盘 io。因此,如果磁盘 io 或 cpu 是您的瓶颈,则单独的集群用于 mapreduce 作业是更好的解决方案。

【讨论】:

  • 是的,磁盘 io 或 cpu 是我关心的问题。我们正在选择另一个集群。是不是,如果我们使用 Snapshot 将数据加载到新集群中,也会在源集群上出现性能问题?
猜你喜欢
  • 1970-01-01
  • 2015-08-26
  • 2023-03-24
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2021-08-10
  • 1970-01-01
  • 2018-04-25
相关资源
最近更新 更多