【问题标题】:Hadoop read input split multiple timesHadoop 多次读取输入拆分
【发布时间】:2012-09-23 10:14:33
【问题描述】:

我需要迭代输入拆分不止一次。 我需要这个的原因超出了这个问题的范围。假设我只需要它(简短的解释是我需要多次使用输入拆分来填充数据结构,并且拆分可能足够大,以至于在第一次迭代后它无法容纳在内存中)

我想我可以做一些技巧,例如扩展 FileInputFormatRecordReader 以多次服务拆分,但我想知道在 Hadoop 中是否有任何“标准”方式来做这件事。 我不知道在 Hadoop 中实现这一目标的任何标准方法,但可能我错过了一些东西。

有什么想法吗?

【问题讨论】:

    标签: input hadoop split iteration regression


    【解决方案1】:

    在多次通过拆分期间,您想对该数据结构执行什么操作? (查找、更新等)

    您是否尝试过对一些早期的 hadoop 作业(甚至可能是一些猪脚本)进行并行 izig 操作?

    【讨论】:

    • 更准确地说,我正在根据拆分中的数据构建回归树。使用不驻留在内存中的数据构建回归树意味着多次传递数据。我想在本地做,只在只有一个 MR 工作的地图方面。每个映射器学习一棵树!
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-02-19
    • 1970-01-01
    • 1970-01-01
    • 2015-12-14
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多