【问题标题】:hadoop logging facility?hadoop 日志记录工具?
【发布时间】:2012-11-17 13:08:14
【问题描述】:

如果我要将 zookeeper 用作工作队列并将单个消费者/工作人员连接到它。您会推荐什么作为记录这些工作人员活动的良好分布式设置?

假设如下:

1) 在任何时候,我们都可以减少到 1 台容纳 hadoop 集群的计算机。系统将根据需要自动扩展和缩减,但在只需要一台计算机的情况下会出现很多停机时间。

2) 我只需要能够访问所有工作人员日志而不访问工作人员所在的单个机器。请记住,当我阅读这些日志之一时,这台机器很可能已经终止并且早已不复存在。

3) 我们需要轻松访问日志,即能够 cat/grep 和 tail 或者以更 SQLish 的方式 - 我们需要实时查询和监控输出的能力实时时间。 (即tail -f /var/log/mylog.1)

在这里感谢您的专家意见!

谢谢。

【问题讨论】:

    标签: hadoop hdfs apache-zookeeper


    【解决方案1】:

    您是否考虑过使用 Flume、chukwa 或 scribe - 确保您的 Flume 等进程可以访问您尝试聚合到集中式服务器上的日志文件。

    水槽参考: http://archive.cloudera.com/cdh/3/flume/Cookbook/

    楚夸: http://incubator.apache.org/chukwa/docs/r0.4.0/admin.html

    抄写员: https://github.com/facebook/scribe/wiki/_pages

    希望对你有帮助。

    【讨论】:

      【解决方案2】:

      Fluentd 日志收集器刚刚发布了它的 WebHDFS 插件,它允许用户即时将数据流式传输到 HDFS。它非常易于安装且易于管理。

      当然,您可以直接从您的应用程序中导入数据。这是一个针对 Fluentd 发布日志的 Java 示例。 Fluentd 的 Java 库足够聪明,可以在 Fluentd 守护进程关闭时进行本地缓冲。这减少了数据丢失的可能性。

      还提供高可用配置,基本可以让你拥有集中的日志聚合系统。

      【讨论】:

        猜你喜欢
        • 2011-06-16
        • 1970-01-01
        • 1970-01-01
        • 2023-04-10
        • 2019-07-30
        • 1970-01-01
        • 2012-05-03
        • 2011-02-09
        • 1970-01-01
        相关资源
        最近更新 更多