【发布时间】:2015-10-01 07:55:16
【问题描述】:
我完成了我的 hadoop 课程,现在我想在 Hadoop 上工作。我想知道从数据摄取到可视化数据的工作流程。
我知道生态系统组件是如何工作的,并且我已经构建了具有 8 个数据节点和 1 个名称节点的 hadoop 集群: 1 namenode --Resourcemanager,Namenode,secondarynamenode,hive 8个datanodes--datanode,Nodemanager
我想知道以下几点:
- 我得到了数据 .tar 结构化文件,前 4 行有描述。我有点困惑如何处理这种类型的数据。 1.a 我可以直接处理数据,因为这些是 tar 文件。如果是,如何删除前四行中的数据,我应该解压缩并删除前 4 行 1.b,我想使用 hive 处理这些数据。
请建议我如何做到这一点。
提前致谢。
【问题讨论】:
标签: hadoop hive hadoop-streaming