【问题标题】:Hadoop Input Splits and Record ReaderHadoop 输入拆分和记录读取器
【发布时间】:2016-01-19 16:10:18
【问题描述】:

阅读 apache 文档:

InputSplit 表示要由单个 Mapper 处理的数据。

通常,它在输入上呈现面向字节的视图,作业的 RecordReader 负责处理此内容并呈现面向记录的视图。

链接 - https://hadoop.apache.org/docs/r2.6.1/api/org/apache/hadoop/mapred/InputSplit.html

有人能解释一下面向字节的视图和面向记录的视图之间的区别吗?

【问题讨论】:

    标签: hadoop


    【解决方案1】:

    HDFS 拆分其块(面向字节的视图),以便每个块小于或等于配置的块大小。因此,它被认为没有遵循逻辑拆分。意味着最后一条记录的一部分可能位于一个块中,其余部分位于另一个块中。这对于存储来说似乎是正确的。但是在处理时,不能按原样处理块中的部分记录。因此,面向记录的观点应运而生。这将确保在另一个块中获取最后一条记录的剩余部分,使其成为完整记录的块。这称为输入拆分(面向记录的视图)。

    【讨论】:

    • 我真的很喜欢这个答案!
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-11-13
    • 1970-01-01
    • 1970-01-01
    • 2011-02-19
    • 2017-01-28
    相关资源
    最近更新 更多