【发布时间】:2019-05-06 07:12:30
【问题描述】:
我想在我的笔记本电脑上安装 hadoop、pig 和 hive。我不知道如何安装和配置hadoop、pig和hive以及需要什么软件。
请告诉我在笔记本电脑中安装/配置 Hadoop、Pig 和 hive 所需的确切步骤。
我可以使用 windows 操作系统,我在 windows 操作系统中安装 hadoop
【问题讨论】:
标签: hadoop hive apache-pig
我想在我的笔记本电脑上安装 hadoop、pig 和 hive。我不知道如何安装和配置hadoop、pig和hive以及需要什么软件。
请告诉我在笔记本电脑中安装/配置 Hadoop、Pig 和 hive 所需的确切步骤。
我可以使用 windows 操作系统,我在 windows 操作系统中安装 hadoop
【问题讨论】:
标签: hadoop hive apache-pig
对于初学者,我建议坚持使用良好的预打包 Hadoop 发行版/沙盒。即使您想在使用它提供的工具(例如 Hive 等)之前了解如何设置 Hadoop 集群,至少在开始时设置一个通用的分布要容易得多。
Hadoop 的预打包沙箱将在 Linux 中使用。但很可能,如果您从这些沙箱开始,您不需要在 Linux 中做很多事情就可以开始使用 Hadoop。就个人而言,我认为通过避免 Windows 端口上的支持和文档问题所节省的时间将大大弥补进入 Linux 所需的任何额外努力,并且你至少会进入 Linux 领域,它本身就是一个非常重要的工具。
对于预打包的解决方案,您可以尝试针对Cloudera quickstart VM 或MapR quickstart VM,因为这些是使用最广泛的发行版。通过使用沙箱,您将跳过安装过程(如果您不知道自己想要什么,特别是如果您不熟悉 Linux,这可能会很忙)并直接使用工具。由于 Cloudera 和 MapR 等大型供应商提供了良好的文档,您在访问您想学习的工具时也将面临较少的问题。
请遵循供应商特定的设置指南(也在下载页面上作为入门指南列出),了解有关设置沙盒的更多详细信息。
设置好沙盒后,您可以使用多种不同的方式访问 Hive 和 Pig。您可以使用 Hive 的命令行界面(称为直线)。如果您熟悉 JDBC,则可以通过它访问 Hive。安装 Apache-Thrift 以启用更广泛的访问选项,但您也可以将其保存以备后用。
除非你有非常具体的用途,否则我不建议学习 Pig。如果您熟悉 Java(或 Scala,甚至 Python,以及其他选项),请尝试编写一些 Map-Reduce 样式的作业,以了解有关 Hadoop 工作原理的更多信息。打开这些沙箱预配置的 Ambari(或 Cloudera Manger 等)界面,查看沙箱预打包的工具和服务。这些是最常见的,可以用作初学者的有用列表。开始了解它们(但如果可以,请跳过 Pig,即使它已预先安装;)
一旦您熟悉了您拥有的沙箱,我建议您选择 Apache Nifi,它具有更轻松的学习曲线并具有很大的灵活性。但是您很可能必须为此设置一个新的沙箱。它也可以作为学习的一个很好的复习练习。将其与您的 Hadoop 沙箱集成,实现一些体面的用例,您将获得一些很好的体验。
【讨论】: