【问题标题】:Nutch Parser Plugin Collect Contact InformationNutch Parser 插件收集联系信息
【发布时间】:2016-02-09 18:43:14
【问题描述】:

我正在开展一个项目,该项目需要识别公司网站上的联系点并用于增强安全性。

现在,我设法使用 Apache Nutch 抓取了几轮网站。下一步将是解析 HTML 页面并找到联系信息的位置。在这种情况下,我只对电子邮件地址和电话号码感兴趣....

这是我打算做的,我们可以编写一个 map reduce 作业来解析 HTML 文件,并使用正则表达式之类的东西与 Jsoup/Beautifulsoup HTML 解析器组合来查找正则表达式。

但是,我想知道是否有任何解析器插件已经实现并可能用于此目的的测试?

【问题讨论】:

    标签: plugins nutch


    【解决方案1】:

    您不需要编写自定义地图缩减作业。只需实现一个定制的 HTMLParseFilter,如果您需要正则表达式,它将为您提供一个 DOM 以在 + 文档文本上运行 XPath 表达式。

    几年前我曾为一位客户做过类似的工作,我发现有很多页面实现了 schema.org。您可以使用 Xpath 编写自定义 HTMLParse 过滤器,以从微数据中提取规范化信息。您可以查看用于 StormCrawler 的 microdata parser 作为如何利用 Apache Any23 提取微数据的示例。

    如果您想要更密集的 NLP 方法,您可以使用 Behemoth 使用 Apache UIMA 或 GATE 等工具处理 Nutch 片段。

    HTH

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2013-07-09
      • 1970-01-01
      • 2020-10-28
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多