【发布时间】:2018-08-02 11:22:27
【问题描述】:
我已经使用 Hadoop 2.7.5 和 Hbase 0.98 配置了 apache Nutch 2.3.1。我必须抓取一些乌尔都语网站。我正在使用它的默认解析器,即 html、tika。有些文件的标题是乌尔都语,没问题,但有些文件的标题是乌尔都语,标题为 1,即 h1 具有原始标题,例如bbc-page。同样,在某些情况下,元标记具有相关标题。是否有任何内置选项(解析器)可以处理此选项,以便它应该选择 h1 作为标题(如果可用)。
或者如果我必须这样做,有什么可能的方法来达到这个目的。
【问题讨论】:
标签: parsing nutch apache-tika nutch2