【发布时间】:2013-10-11 01:11:37
【问题描述】:
我在 hdfs 中有一个包含数千个 HTML 文件的输入文件夹:
/data/htmls/1/(HTML files)
/data/htmls/2/(HTML files)
.
.
/data/htmls/n/(HTML files)
我有一个 java 函数,它将 HTML 文件作为输入并解析它,我想在映射器函数中读取这些 HTML 文件并将它们作为输入提供给解析器函数。因为输入文件是由map函数逐行处理的,有没有办法处理HTML文件?
【问题讨论】:
-
逐行读取它们的事实是您正在使用的 InputFormat 的一个特性。您可以编写自己的(或者我想已经编写了 XML 输入格式)来处理整个 HTML 文件
-
输入文件有多大?如果它们与块大小相比较小,您可以查找
NLinesRecordReader并修改它以读取完整的 html 文件。我做了那些类似的事情。
标签: java html hadoop mapreduce