【问题标题】:HDP 2.4, How to collect hadoop mapreduce log using flume in one file and what is the best practiceHDP 2.4,如何在一个文件中使用flume收集hadoop mapreduce日志以及最佳实践是什么
【发布时间】:2018-04-12 20:42:39
【问题描述】:

我们正在使用 HDP 2.4 并且有许多以各种方式(java MR/Hive/等)编写的 map reduce 作业。日志收集在应用程序 ID 下的 hadoop 文件系统中。我想收集应用程序的所有日志并附加到单个文件(一台机器的 hdfs 或 OS 文件)中,以便我可以在一个位置轻松分析我的应用程序日志。还建议我在 HDP 2.4 中实现的最佳方法(堆栈版本信息 => HDFS 2.7.1.2.4 / YARN 2.7.1.2.4 / MapReduce2 2.7.1.2.4 / Log Search 0.5.0 / Flume 1.5.2.2.4 ) .

【问题讨论】:

标签: hadoop logging mapreduce bigdata


【解决方案1】:

Flume 无法收集已经在 HDFS 上的日志。

为了做到这一点,你需要在所有 NodeManager 上运行一个 Flume 代理,指向配置的 yarn.log.dir,并以某种方式从本地 OS 文件路径中解析出应用程序/容器/尝试/文件信息。

我不确定收集到“单个文件”的效果如何,因为每个容器至少会生成 5 个不同信息的文件,但 YARN 日志聚合已经做到了这一点。只是not in a readable file format in HDFS unless you are using Splunk/Hunk, as far as I know

替代解决方案包括将这些文件索引到 Solr 或 Elasticsearch 等实际搜索服务中,我建议将其用于通过 HDFS 存储和搜索日志

【讨论】:

    猜你喜欢
    • 2015-07-12
    • 2014-11-12
    • 2013-11-19
    • 1970-01-01
    • 2017-11-17
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多