【问题标题】:Apache Nutch title parsing issue for Language specific websites特定语言网站的 Apache Nutch 标题解析问题
【发布时间】:2018-08-02 11:22:27
【问题描述】:

我已经使用 Hadoop 2.7.5 和 Hbase 0.98 配置了 apache Nutch 2.3.1。我必须抓取一些乌尔都语网站。我正在使用它的默认解析器,即 html、tika。有些文件的标题是乌尔都语,没问题,但有些文件的标题是乌尔都语,标题为 1,即 h1 具有原始标题,例如bbc-page。同样,在某些情况下,元标记具有相关标题。是否有任何内置选项(解析器)可以处理此选项,以便它应该选择 h1 作为标题(如果可用)。

或者如果我必须这样做,有什么可能的方法来达到这个目的。

【问题讨论】:

    标签: parsing nutch apache-tika nutch2


    【解决方案1】:

    如果在 DOM 树 (https://github.com/apache/nutch/blob/bb2a7adddbc5c780151bb9957d68af52be7339ca/src/plugin/parse-tika/src/java/org/apache/nutch/parse/tika/DOMContentUtils.java#L251) 中找到 title 标签,Nutch 将使用此标签,为此您需要在解析器插件中编写自定义逻辑。但真正的问题是如何识别“坏”title 标签?将是一些特定的内容(如 URL)。

    在任何情况下,您都需要在解析器或索引插件中编写自己的插件(例如在某些条件下获取一个字段并将其复制到标题字段)。

    【讨论】:

    • 那是兄弟,实际上在一些爬取的文档中有些标题完全是非乌尔都语,这些标题不适合我们的案例。
    • 在这种情况下,您可以编写自己的插件来识别标题的语言,如果它与文档的语言不同(假设为您的网页正确设置/识别了语言)将从h1 标记复制文本。不幸的是,没有内置的方法可以做到这一点。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2013-02-02
    • 1970-01-01
    • 1970-01-01
    • 2011-07-07
    • 2021-01-30
    • 2016-02-16
    • 1970-01-01
    相关资源
    最近更新 更多