【发布时间】:2015-03-30 16:23:08
【问题描述】:
我想知道,如果我在本地模式下使用 pig(内部调用 Map reduce)与使用 PIG-withouthadoop.jar 文件相比,性能增益或损失是多少?
PIG-withouthadoop.jar真的不用hadoop吗???
如果我只想在没有集群的情况下使用 Pig,比如设计数据流,那么我应该使用什么?本地模式下的 Pig 或 pig-withouthadoop.jar 文件??
目前我已经使用 pig 本地模式编写了我的脚本,并且在尝试在服务器中部署并在本地模式下设置 PIG 时,我认为在设置 PIG_HOME 变量之前我还需要在环境变量中设置 HADOOP_HOME
请多多指教..
提前致谢。 :)
【问题讨论】:
-
已经等待了很长时间..请提供任何想法或分享一些关于这个问题的信息..问候.. :)
-
我知道如果我在位于 $PIG_HOME/bin 的 pig 文件中添加 HADOOP_BIN=,那么我不需要再设置 hadoop_home,所以这里发生了什么......它那不需要hadoop了??
标签: hadoop mapreduce apache-pig bigdata dataflow