【问题标题】:When to move data to HDFS/Hive?何时将数据移动到 HDFS/Hive?
【发布时间】:2015-10-06 00:21:57
【问题描述】:

所以我正在开发一个预计会处理大量数据的应用程序,因此我决定使用 Hadoop 来处理它。

我的服务节点和数据节点与 webapp 是分开的,所以我使用 HttpFS 将应用程序与 Hadoop 进行通信。

那么,每当在我的应用程序中生成新的 行 数据时,我是否应该已经调用相应的 HttpFS URL 来将数据附加到 HDFS 文件中?我是否应该将这些数据写入网络服务器中的文件并使用 cronjob 将其上传到 HDFS,例如每小时? 我应该更新 Hive 表,还是应该在需要查询时只在其中加载数据?

我对 Hadoop 还很陌生,所以任何可以提供帮助的链接也会很有用。

【问题讨论】:

    标签: hadoop hive hdfs


    【解决方案1】:

    我更喜欢下面的方法。

    1. 不要调用 HtpFS URL 将数据附加到 HDSF 文件以进行每行更新。当数据文件大小超过 128 MB(在 Hadoop 2.x 中)或 64 MB(在 Hadoop 1.x 中)时,HDFS 非常高效

    2. 将数据写入网络服务器。当文件大小达到一定限制时有一个滚动附加程序 - 128 MB 的倍数,例如 1 GB 文件。

    3. 您可以执行基于小时的 cron 作业,但请确保您发送的是大数据文件(例如 1 GB 或 128 MB 的倍数),而不是仅发送日志文件,该文件在 1 小时内累积。

    4. 关于数据的加载,您可以使用内部或外部 HIVE 表。看看这个article

    【讨论】:

    • 谢谢!这非常有用。您能否解释一下如何为这个 4 步过程配置 oozie?我发现它与所有配置文件和东西有点混淆
    • 我正在逐章学习和练习 hadoop 权威指南。掌握 oozie 可能需要 1 或 2 周时间
    猜你喜欢
    • 2012-05-18
    • 2012-07-17
    • 1970-01-01
    • 2015-05-06
    • 1970-01-01
    • 2013-05-29
    • 1970-01-01
    • 1970-01-01
    • 2020-05-06
    相关资源
    最近更新 更多