【问题标题】:Any one implementing or working on impala from cloudera? [closed]任何人从 cloudera 实施或使用 impala? [关闭]
【发布时间】:2013-01-06 18:41:10
【问题描述】:

Hadoop 技术让我很困惑(Hbase、flume、oozie、scoop、zookeeper、Hive、hue、Bigtop、pig),现在它的 impala。有人可以定义它们是如何集成的吗?(我是一名 informatica 开发人员,对 Java 知之甚少)至少在数据件外壳方面!

【问题讨论】:

  • @CharlesMenguy 也许如果您真的希望该标签存在,您应该将其添加到不是关闭的问题中,因为没有建设性。
  • @Charles 我不关心标签,它没有“impala”标签是没有意义的,因为这是一个关于那个确切的问题的问题!当我偶然发现这个问题时,当前的标签都没有反映问题的内容。正如人们在 meta 上所说的那样,即使是封闭的问题也应该很容易搜索,但目前情况并非如此。但如果“新标签删除主义阴谋集团”拒绝这个标签,我会遵守的。
  • @CharlesMenguy,问题是您在编辑说明中声明“已经有多个关于该主题的问题” - 然后找到它们并标记 them 。为已关闭的问题(无法挽救)创建一个新标签 just 是疯狂的。

标签: hadoop hbase hive cloudera


【解决方案1】:

最好尝试了解每个项目的具体内容。大多数人不需要全部使用。

HDFS:分布式文件系统。它获取文件,将它们分成块,然后将它们分布在集群中。它复制这些块以实现冗余,并使数据靠近可能在作业中被分析的位置。它通常直接用于存储日志和文本等非结构化数据。

MapReduce:用于运行并行程序的编程模型和软件工具集。 “YARN”是一个较新的想法,它允许跨 Hadoop 集群执行其他程序,以及“MapReduce”的最新版本或在此“YARN”集群上运行的程序。这里有很多要解释的,你可能已经基本熟悉了,所以我继续……

HBase:一种非关系型数据库,将其数据保存到 HDFS,其结构类似于 Google 的 BigTable。它将数据存储在内存中,以提供近乎实时的查找和实时服务。它通常用于而不是直接将 HDFS 用于结构化数据,例如网站的用户。

Flume:一种用于管理数据(如日志)的工具,因为它不断地输入 HDFS。

Oozie:一种从 MapReduce 作业序列构建更复杂作业的工具。

Sqoop:用于在 HDFS 和关系数据库之间导入/导出数据的工具。它通过将要执行的作业编译成 MapReduce 作业来做到这一点。

Zookeeper:“集群协调服务”。我认为这是一个分层文件系统(用于相对较小的数据块),可让您构建集群范围的互斥锁、获取更改通知等。这可能很难解释,但它基本上为您提供了一组操作可以用来在集群中构建相当复杂的协调机制。 HBase 为此使用 Zookeeper。

Hive:一种将类似 SQL 的查询转换为 MapReduce 作业的工具。 (Pig 是一个类似的想法——它是一种编译成 MapReduce 作业的编程语言)。

Hue:“Hue 用户体验”——它是一个基于浏览器的 UI,用于使用 Hue 等 Hadoop 工具。它也是由 Cloudera 制作的,但与 Cloudera Manager 等旨在管理集群而不是使用服务本身的工具不同。

Bigtop:以各种方式打包 hadoop 生态系统的许多组件和类似工具(例如,用于 Linux 的 DEB 和 RPM、用于部署 Hadoop 的 Puppet 代码,甚至是 Live CD)。它实际上是为了开始简化和标准化您所指的“集成”。

Pig:与 Hive 类似的想法 - 一种编译成 MapReduce 作业的编程语言。

Impala:使用类似 SQL 的查询来探索 Hadoop 中的数据的工具。作为支持比 Hive 更简单的查询语言并且不使用 MapReduce(用于大批量作业)的交换,它应该使查询足够快,以交互方式探索大型数据集。

【讨论】:

  • 非常感谢您的解释。
猜你喜欢
  • 1970-01-01
  • 2018-05-12
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2017-09-24
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多